本周研究揭示:决定智能体下一步行动的数字
摘要
本文总结了近期关于智能体评分机制的AI研究,讨论了安全评分的局限性、工具路由优化以及训练过程中奖励信号的挑战。
如果您在运行演示之外的智能体,您已经在使用某个数字来判断步骤的好坏。一个实时的判断者,工具上的一个监控器,重放时的一个奖励。这个数字决定了接下来会发生什么。但没有人问这个数字是否诚实。我运营一个名为 The Attention Layer 的AI研究周刊。每周一个系统阅读约1000篇新论文,并草拟一期内容。在发布前,我会检查这些数字。当前一期正好讨论了这个问题。以下是我关注到的要点。安全评分可能会将成功的攻击排在最后。在 Llama-3.1-8B-Instruct 上,包装一个有害请求将生成从0.05提升到0.27。同样的评分在识别意图方面表现良好,AUROC 为0.803,但在识别模型实际行为方面表现不佳,AUROC 为0.220。您必须对结果评分,而不是意图。工具路由器仍然为平面列表支付语法成本。Trie Automata 为固定字符串集预计算掩码。在 K=1,000 和批次256时,它达到每秒219个请求,而 XGrammar 为7.5。论文称29倍。但不受限的 vLLM 为104,因此真正的差距在于服务路径,而不仅仅是更快的掩码。奖励在您最想训练的组上可能会沉默。在 SKALD 中,GRPO 在每次滚动都正确或都错误时不给出信号。零方差组占1.7B训练的63%。仅对零方差组进行蒸馏达到49.63,而匹配的 GRPO 为45.52。这是完整增益的84.7%。洗牌的卡片达到48.83。沉默是真实的。卡片内容则不那么确定。
相似文章
超越最终分数:长期AI研发智能体的系统性评估
本文系统评估了七个前沿AI智能体在长期任务上的表现,发现它们更像是工程优化器而非自主研究者,并提出了改进训练和经验管理的建议。
如何评估技能以构建更好的智能体工具
一篇文章讨论评估技能的方法,以构建更好的智能体工具,可能侧重于AI智能体开发的实用方法。
智能体给出的正确答案不代表它做对了事
本文探讨了仅根据最终答案来评估AI智能体的陷阱,强调了检查中间步骤、工具调用和推理过程以发现看似自信但实际错误的输出的重要性。文章建议使用自动评分和轨迹回放来测量并改进智能体的行为。
你们实际如何评估代理决策,而非仅评估输出?
作者质疑如何超越简单的通过/失败指标来评估AI代理决策,提出了成本加权评估和置信度校准。
@loganthorneloe: https://x.com/loganthorneloe/status/2075684831233757275
本周精选五篇值得关注的AI文章,涵盖自我改进代理、Bun向Rust迁移、vLLM架构、编码评估基准以及代理自主性等级。