CAST:用于训练可靠长程工具调用代理的批判感知监督
摘要
CAST是一个批判感知的训练框架,通过从稀疏结果生成结构化的动作级别理由来提高LLM代理的可靠性,在工具调用基准测试中超越了GPT-OSS-120B。
查看缓存全文
缓存时间: 2026/09/01 11:52
论文页面 - CAST:用于训练可靠长期工具调用智能体的批判感知监督
来源:https://huggingface.co/papers/2608.30147 发布于 8月31日
·
由https://huggingface.co/sahsaeedi提交
Amir (https://huggingface.co/sahsaeedi)于9月1日发布
摘要
CAST 通过从稀疏结果中生成结构化的动作级解释,来训练批判模型与策略模型,从而提高 LLM 智能体的可靠性。
大型语言模型(LLM)智能体正被越来越多地部署于长期、交互式和有状态的环境中。在这些场景中,单个错误动作——例如退款错误的订单——可能导致不可逆的任务失败,必须在执行前予以拦截。这类故障可能不会在每一次运行中都出现,但会在多次尝试中显现,因此跨步骤和跨尝试的可靠性至关重要。然而,确保智能体的可靠性颇具挑战:即使是前沿的LLM,也难以解释为什么某个动作可能是错误的,尤其是在受领域特定策略约束的长而复杂的交互轨迹中。近期许多研究依赖基于提示的批判智能体,而基于优化的方法则缺乏一种系统化的方式来生成用于训练的丰富验证解释。我们通过CAST来弥合这一差距,这是一个批判感知训练框架,能够将稀疏的任务结果转化为动作级监督,用于批判学习和策略优化。CAST 分析智能体轨迹,以合成结构化的解释,阐明在部分可观察性下动作的有效性。由此产生的批判模型被用于构建批判感知训练数据,以优化策略模型。在动态工具调用基准测试上对Qwen3系列模型进行微调后,CAST 在多个领域提升了可靠性,在零售任务上以超过10%的 pass^4 指标超越了 GPT-OSS-120B,并在跨领域的远程医疗任务上带来了额外的9%的提升。这些结果表明,批判感知训练能够提高LLM智能体在现实动态环境中的鲁棒性。
查看 arXiv 页面 (https://arxiv.org/abs/2608.30147)查看 PDF (https://arxiv.org/pdf/2608.30147)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.30147)
引用此论文的模型
0
尚无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.30147,即可从此页面链接至该论文。
引用此论文的数据集
0
尚无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.30147,即可从此页面链接至该论文。
引用此论文的 Space
0
尚无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.30147,即可从此页面链接至该论文。
包含此论文的收藏夹
0
尚无收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)即可从此页面链接至该论文。
相似文章
CAST: 游戏求解器作为LLM智能体的回合级教师
CAST是一种方法,利用游戏求解器的状态值来提供回合级信用分配信号,通过强化学习训练LLM智能体,在多个游戏中的领域内和未见难度评估中均优于基线。
@omarsar0: 苹果的一篇很棒的论文。大多数对工具调用智能体的评估都发生在轨迹结束之后。但那时错误的调用早已发出。这篇新论文将评估移入执行循环中。一个专门的审稿智能体在执行前检查每个临时工具调用。如果有问题,它注入反馈,主智能体进行修正。为了量化修正与新错误之间的权衡,他们提出了“有益性-有害性”指标。有益性衡量基础错误被修复的百分比;有害性衡量因审稿而降低正确调用质量的比例。在 BFCL 上的结果:无关检测准确率提升 5.5%(从 84.9% 到 90.4%),相关检测提升 1.6%,且无需重新训练基础智能体。在 τ²-Bench 多轮任务上提升 7.1%(从 48.7% 到 55.8%)。推理模型审稿者比 GPT-4o 获得 3:1 的收益风险比,而 GPT-4o 为 2.1:1。加入 GEPA 提示优化可再提升 1.5–2.8%。为什么这很重要?你可以保持基础工具调用智能体不变,仅通过改进审稿者即可实现显著的准确性提升。对审稿者的模型选择和提示优化成为独立的生产杠杆。论文链接:https://arxiv.org/abs/2604.27233 在我们的学院学习如何构建高效的 AI 智能体:https://academy.dair.ai
这篇来自苹果的研究论文介绍了“强化智能体”(Reinforced Agent)方法,通过使用专门的审稿智能体在实时执行过程中修正工具调用错误,将评估纳入执行循环。它在 BFCL 和 τ²-Bench 等基准测试上展示了显著的准确性提升,而无需重新训练基础智能体。
超越函数调用:在工具环境不可靠性下对工具使用代理进行基准测试
介绍ToolBench-X,这是一个基准测试,用于评估各种工具环境可靠性隐患下的大语言模型代理,揭示了与干净环境相比性能上的显著差距。
超越排行榜:大型语言模型代理中工具使用、规划与推理失败的综合分析
本文综合了2023-2026年间27篇基准测试、分类学和审计论文,形成了一个统一的LLM代理局限性分类体系,识别出六大失败集群,包括工具调用错误、规划失败、长期退化、多代理协调问题、安全性问题以及测量有效性问题。
Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives
This paper introduces NCP-Bench, a benchmark derived from 100 movie synopses for evaluating long-horizon narrative consistency in LLM-based interactive storytelling agents. Experiments show that even strong models like GPT-5.2 struggle to maintain logical consistency, with a 42% survival rate after 20 turns and high fact conflict rates.