标签
TerminalTraj是一个可扩展的流水线,利用Docker化环境生成高质量的终端智能体轨迹,在终端任务基准上使用TerminalTraj-32B等模型实现了高达20%的性能提升。
本文以会议论文数据集抽取为测试平台,研究反思与记忆等智能体机制是否能在学术PDF信息抽取中,相对于固定LLM工作流带来可控的改进。
TACO提出了一种针对代码工具智能体的新型信用优化方法,该方法使用差分奖励探针和结果门控优势路由来区分有用、冗余或误导性的工具调用,从而提升多模态智能体的性能。
本文介绍了OpenThoughts-Agent,一个开源的用于训练智能体语言模型的数据整理流程,在七项基准测试中取得了44.8%的平均准确率,并通过系统性实验超越了先前的开源数据集。
OpenBioRQ 是一个包含12,553个未解决生物医学研究问题的新基准,用于测试智能体模型验证来源和避免虚假引用的能力。该基准揭示,当前模型经常链接到错误的论文,并在难题上出现智能体崩溃。
Nex-N2-Pro是NexEcosystem新推出的开源LLM,据报道在基准测试中优于Kimi-K2.6和DeepSeek-V4-Pro等领先模型,具有自适应和连贯思维的特点。
Magma 是微软研究院推出的一个开源仓库,用于构建整合视觉、语言和行动的多模态 AI 智能体,提供模型链接、推理示例、训练说明和演示。
微软推出了Fara1.5系列小型浏览器代理(4B、9B、27B),在计算机使用基准测试中取得了最先进的性能,在Online-Mind2Web上得分63%,并超越了Operator和Gemini等更大规模的模型。
Andrej Karpathy讨论了OpenClaw时刻之所以引起广泛共鸣,是因为非技术受众首次接触到了超越ChatGPT消费级产品的先进agentic AI模型。