标签
本文讨论了需要建立一个基准来独立评估AI代理运行时而非仅仅模型,建议衡量任务成功率、成本等指标,并提出通过对照实验来比较不同平台。
Apodex 1.1 mini 在代理基准测试上取得了竞争性的性能,参数远少于像 Kimi K2.6 这样的大型模型,突出了部署成本优势。
微软的一篇论文提出了一种方法,用过去代理运行中蒸馏的技能来替代昂贵的测试时推理,在某些基准测试中表现出竞争力,同时减少了输出令牌的使用。
DeepSeek officially released DeepSeek-V4-Flash on the API in public beta, with significantly enhanced agent capabilities, new benchmark results, and native support for the Responses API and Codex integration.
本文扩展了AssetOpsBench,增加了智能电网变压器资产类别,并引入了ScenarioGeneratorAgent,一个用于合成工业智能体场景生成的流水线,在保持场景质量的同时实现了8倍的运行时间改进。
文章报道,蚂蚁的Ring-2.6,一个MIT许可下的开放权重万亿参数模型,据称在推理和智能体基准测试上与封闭前沿模型不相上下,引发了对开放模型追赶上来会产生何种影响的疑问。
本文介绍了Simple Strands Agent (SSA),这是一个最小化的框架,旨在缩小AI模型与其智能体行为之间的意图-执行差距,并通过分析各类模型家族的138k条轨迹,揭示细粒度的行为差异。
研究人员提出了一种利用LLM代理的对抗性黑客-修复循环,自动修补代理基准测试中脆弱的验证器,在KernelBench上将攻击成功率从62%降至0%,并证明较弱的防御者可以压制更强的攻击者。
Anchor是一个任务生成流水线,通过从单一的约束优化规范中联合生成指令、环境、解决方案和验证器,解决了AI智能体基准中的工件漂移问题,为企业工作流提供一致且可审计的评估任务。论文介绍了ERP-Bench——一个包含生产级ERP系统中300个长时任务的基准,结果显示前沿模型在26.1%的试验中满足显式约束,但仅17.4%的试验达到最优解。
TASTE是一种自动化方法,通过自适应对比n-gram建模和迭代难度优化来演化工具序列,从而生成覆盖更广工具使用、更具挑战性的智能体基准测试。生成的τ^c-Bench显示,在现有基准测试中几乎饱和的模型性能大幅下降,表明这是基准饱和而非模型具备稳健能力。
SynAE 是一个评估框架,用于衡量工具调用智能体评测中使用的合成数据的质量,从有效性、保真度和多样性等多个维度进行评估。它通过提供指导合成数据生成的指标,应对真实数据不足或敏感带来的挑战。
本文介绍了针对代理型计划-执行流水线的时序语义缓存与MCP工作流优化,在缓存命中时实现了高达30.6倍的加速,并在AssetOpsBench工业基准测试上实现了1.67倍的整体加速。