CAST:用于训练可靠长程工具调用代理的批判感知监督

Hugging Face Daily Papers 论文

摘要

CAST是一个批判感知的训练框架,通过从稀疏结果生成结构化的动作级别理由来提高LLM代理的可靠性,在工具调用基准测试中超越了GPT-OSS-120B。

大语言模型(LLM)代理正越来越多地部署在长程、交互和有状态的环境中。在这些设置中,单个错误动作,如退还错误购买,可能导致不可逆的任务失败,必须在执行前拦截。此类故障可能不会在每次运行中出现,但在重复试验中可能出现,使得步骤和试验间的可靠性至关重要。然而,确保代理可靠性具有挑战性:即使前沿LLM也难以解释为什么一个动作可能是错误的,尤其是在由领域特定策略管理的长而交织的轨迹中。许多近期工作依赖于基于提示的批判代理,而基于优化的方法缺乏系统性的方式来为训练产生丰富的验证理由。我们通过CAST来解决这一差距,这是一个批判感知的训练框架,它将稀疏的任务结果转换为用于批判学习和策略优化的动作级别监督。CAST分析代理轨迹以合成结构化理由,在部分可观测性下解释动作的有效性。由此产生的批判模型用于构建批判感知训练数据以优化策略模型。在动态工具调用基准测试上微调Qwen3系列模型,CAST提高了跨领域的可靠性,在Retail任务上超越GPT-OSS-120B超过10% pass^4,并在Telehealth的域外设置中额外提高了9%。这些结果表明,批判感知训练提高了LLM代理在现实动态环境中的鲁棒性。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:52

论文页面 - CAST:用于训练可靠长期工具调用智能体的批判感知监督

来源:https://huggingface.co/papers/2608.30147 发布于 8月31日

·

由https://huggingface.co/sahsaeedi提交

Amir (https://huggingface.co/sahsaeedi)于9月1日发布

摘要

CAST 通过从稀疏结果中生成结构化的动作级解释,来训练批判模型与策略模型,从而提高 LLM 智能体的可靠性。

大型语言模型(LLM)智能体正被越来越多地部署于长期、交互式和有状态的环境中。在这些场景中,单个错误动作——例如退款错误的订单——可能导致不可逆的任务失败,必须在执行前予以拦截。这类故障可能不会在每一次运行中都出现,但会在多次尝试中显现,因此跨步骤和跨尝试的可靠性至关重要。然而,确保智能体的可靠性颇具挑战:即使是前沿的LLM,也难以解释为什么某个动作可能是错误的,尤其是在受领域特定策略约束的长而复杂的交互轨迹中。近期许多研究依赖基于提示的批判智能体,而基于优化的方法则缺乏一种系统化的方式来生成用于训练的丰富验证解释。我们通过CAST来弥合这一差距,这是一个批判感知训练框架,能够将稀疏的任务结果转化为动作级监督,用于批判学习和策略优化。CAST 分析智能体轨迹,以合成结构化的解释,阐明在部分可观察性下动作的有效性。由此产生的批判模型被用于构建批判感知训练数据,以优化策略模型。在动态工具调用基准测试上对Qwen3系列模型进行微调后,CAST 在多个领域提升了可靠性,在零售任务上以超过10%的 pass^4 指标超越了 GPT-OSS-120B,并在跨领域的远程医疗任务上带来了额外的9%的提升。这些结果表明,批判感知训练能够提高LLM智能体在现实动态环境中的鲁棒性。

查看 arXiv 页面 (https://arxiv.org/abs/2608.30147)查看 PDF (https://arxiv.org/pdf/2608.30147)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.30147)

引用此论文的模型

0

尚无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.30147,即可从此页面链接至该论文。

引用此论文的数据集

0

尚无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.30147,即可从此页面链接至该论文。

引用此论文的 Space

0

尚无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.30147,即可从此页面链接至该论文。

包含此论文的收藏夹

0

尚无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)即可从此页面链接至该论文。

相似文章

@omarsar0: 苹果的一篇很棒的论文。大多数对工具调用智能体的评估都发生在轨迹结束之后。但那时错误的调用早已发出。这篇新论文将评估移入执行循环中。一个专门的审稿智能体在执行前检查每个临时工具调用。如果有问题,它注入反馈,主智能体进行修正。为了量化修正与新错误之间的权衡,他们提出了“有益性-有害性”指标。有益性衡量基础错误被修复的百分比;有害性衡量因审稿而降低正确调用质量的比例。在 BFCL 上的结果:无关检测准确率提升 5.5%(从 84.9% 到 90.4%),相关检测提升 1.6%,且无需重新训练基础智能体。在 τ²-Bench 多轮任务上提升 7.1%(从 48.7% 到 55.8%)。推理模型审稿者比 GPT-4o 获得 3:1 的收益风险比,而 GPT-4o 为 2.1:1。加入 GEPA 提示优化可再提升 1.5–2.8%。为什么这很重要?你可以保持基础工具调用智能体不变,仅通过改进审稿者即可实现显著的准确性提升。对审稿者的模型选择和提示优化成为独立的生产杠杆。论文链接:https://arxiv.org/abs/2604.27233 在我们的学院学习如何构建高效的 AI 智能体:https://academy.dair.ai

X AI KOLs Timeline

这篇来自苹果的研究论文介绍了“强化智能体”(Reinforced Agent)方法,通过使用专门的审稿智能体在实时执行过程中修正工具调用错误,将评估纳入执行循环。它在 BFCL 和 τ²-Bench 等基准测试上展示了显著的准确性提升,而无需重新训练基础智能体。