Opus 5.5 is a tool that transforms Minecraft into a realistic Star Wars game experience directly in the web browser.
Google 宣布 Antigravity SDK 现在支持本地 AI 模型工作流,通过 LiteRT 提供 Gemma 4 26B A4B,实现离线智能体能力,带来隐私保护、成本效益和混合编排等优势。
OpenAI 宣布,MentalHealthBench 旨在覆盖 AI 心理健康对话的完整范围,从日常支持到急性危机场景。
This article explains how to use NVIDIA Warp and MjWarp to scale robotics simulations on GPUs, enabling parallel environments for accelerated learning workflows.
AgentRouter 是一个开发者平台,提供统一 API 来访问和切换多个 AI 模型,例如 GPT 和 Claude 变体,用于编码、推理和自动化任务。
Humanity’s Last Exam 的一个更新版本,这是一个用于AI评估的基准,名为 HLE-Diamond,已经宣布并发布。
一个研究项目,展示了一个 GUI harness,允许用户或 LLM 使用简单的矢量图形函数构建复杂应用程序,具有集成代码执行、历史记录管理以及支持多种开放权重 LLM。
在预览版中,uv 将省略锁文件中的包元数据,平均减少锁文件大小最多 50%,并降低冲突。
PersonalJarvis是一个开源、自托管的AI工具,允许使用本地模型或基于API的模型,具有集成浏览器使用、例程、自学习记忆系统,以及超过40个插件,支持自定义MCP服务器和技能。
介绍Strands harness,这是一款新的开源代理框架,提供前沿性能,令牌成本比Claude Code等其他框架低28%,支持多种AI模型并易于部署。
作者开源了Jev Decisions v1,这是一个包含1200万条示例的数据集,用于训练AI模型在代理决策(如工具选择和路由)方面的任务,以解决代理决策中的数据缺口。
作者分享了利用 Jev 和 Pi 构建自定义框架的初步想法,重点关注门控、路由和验证器,并计划在后续文章中进行更深入的探讨。
本文是一篇教程,介绍如何使用 Pi SDK 和 Jev 构建自定义 AI 代理框架。Jev 是一个小型决策模型,用于在代理循环中高效处理工具调用和检查。
Bonsai-Llama-Jev 是一个开源的、支持视觉的类型决策推理系统,可在本地运行,具有低显存占用和高准确率,在多样化基准测试中超越其他系统。
一位用户测试Qoder AI代理工具以自动化竞争对手跟踪,该工具规划研究、并行执行任务并汇编结构化报告,同时提及Qwen3.8-Flash和一项促销积分优惠。
Webcmd 是一个为 AI 代理设计的自学习浏览器基础设施,它通过学习网站导航上下文来减少令牌消耗并提高自动化可靠性。
WebCMD为Chrome等浏览器代理提供记忆功能,保存网站路径以避免重复错误并减少令牌浪费。它在Reddit上进行了测试,并在BU Bench V1中被评为最准确且每任务最便宜的代理。
一种名为JEVfire的新技术使现有的大型语言模型如Qwen在无需重训的情况下,通过修改决策过程来更像Jev,从而实现显著更快的JSON生成,并使本地AI代理能在消费级硬件上高效运行。