tau-bench

标签

Cards List
#tau-bench

并非所有技能都有帮助:衡量与修复智能体知识

arXiv cs.CL · 2026-06-16 缓存

本文指出,在LLM智能体中简单积累技能可能导致性能倒退,因为对某些任务有益的技能反而会损害其他任务。作者提出Assay框架,该框架衡量每个技能的因果贡献,并对每个任务进行掩码处理,在不更新权重的情况下,在AppWorld和τ-bench上取得了最先进的结果。

0 人收藏 0 人点赞
#tau-bench

AI代理能完成任务但仍然算失败吗?

Reddit r/artificial · 2026-06-14

本文引入“验证税”(Verifier Tax)概念,将AI代理的结果分类为安全成功、不安全成功或失败,并为使用工具的LLM代理提出了一种双层验证架构。

0 人收藏 0 人点赞
#tau-bench

如何捕捉AI智能体遗漏应执行操作的情况?

Reddit r/AI_Agents · 2026-05-18

一位开发者探讨了检测AI智能体静默跳过操作时的挑战,强调了区分合理遗漏(如策略阻止)与失败之间的困难,并呼吁合作开发智能体可靠性工具。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈