本周研究揭示:决定智能体下一步行动的数字

Reddit r/AI_Agents 新闻

摘要

本文总结了近期关于智能体评分机制的AI研究,讨论了安全评分的局限性、工具路由优化以及训练过程中奖励信号的挑战。

如果您在运行演示之外的智能体,您已经在使用某个数字来判断步骤的好坏。一个实时的判断者,工具上的一个监控器,重放时的一个奖励。这个数字决定了接下来会发生什么。但没有人问这个数字是否诚实。我运营一个名为 The Attention Layer 的AI研究周刊。每周一个系统阅读约1000篇新论文,并草拟一期内容。在发布前,我会检查这些数字。当前一期正好讨论了这个问题。以下是我关注到的要点。安全评分可能会将成功的攻击排在最后。在 Llama-3.1-8B-Instruct 上,包装一个有害请求将生成从0.05提升到0.27。同样的评分在识别意图方面表现良好,AUROC 为0.803,但在识别模型实际行为方面表现不佳,AUROC 为0.220。您必须对结果评分,而不是意图。工具路由器仍然为平面列表支付语法成本。Trie Automata 为固定字符串集预计算掩码。在 K=1,000 和批次256时,它达到每秒219个请求,而 XGrammar 为7.5。论文称29倍。但不受限的 vLLM 为104,因此真正的差距在于服务路径,而不仅仅是更快的掩码。奖励在您最想训练的组上可能会沉默。在 SKALD 中,GRPO 在每次滚动都正确或都错误时不给出信号。零方差组占1.7B训练的63%。仅对零方差组进行蒸馏达到49.63,而匹配的 GRPO 为45.52。这是完整增益的84.7%。洗牌的卡片达到48.83。沉默是真实的。卡片内容则不那么确定。
查看原文

相似文章

智能体给出的正确答案不代表它做对了事

Reddit r/AI_Agents

本文探讨了仅根据最终答案来评估AI智能体的陷阱,强调了检查中间步骤、工具调用和推理过程以发现看似自信但实际错误的输出的重要性。文章建议使用自动评分和轨迹回放来测量并改进智能体的行为。