信号:用于智能体交互的轨迹采样与分流

Papers with Code Trending 论文

摘要

本文提出了一种轻量级的、基于信号的框架,通过计算低成本指标来高效分流智能体交互轨迹,这些指标能识别出信息丰富的样本,且不影响在线智能体行为,在基准测试上实现了82%的信息率。

基于大语言模型的智能体应用越来越依赖多步交互循环,包括规划、行动执行和环境反馈。尽管此类系统现已大规模部署,但部署后的改进仍然具有挑战性。智能体轨迹数量庞大且非确定性,逐一审查(无论是通过人工审查还是辅助LLM)既缓慢又成本高昂。我们提出了一种轻量级的、基于信号的框架,用于分流智能体交互轨迹。我们的方法从实时交互中计算廉价且广泛适用的信号,并将其作为结构化属性附加到轨迹上用于分流,从而在不影响在线智能体行为的情况下识别出可能信息丰富的交互。我们将信号组织成一个粗粒度的分类体系,涵盖交互(不对齐、停滞、脱离、满意)、执行(失败、循环)和环境(耗尽),设计上无需模型调用即可计算。在 τ-bench(一个广泛使用的工具增强智能体评估基准)上进行的有控制标注研究中,我们展示了基于信号的采样达到了82%的信息率,而启发式过滤为74%,随机采样为54%,每条信息轨迹的效率提升1.52倍。这一优势在奖励层级和任务领域上均稳健,证实了信号提供了真正的每轨迹信息增益,而不仅仅是过度采样明显的失败案例。这些结果表明,轻量级信号可以作为智能体系统的实用采样基础设施,并为偏好数据构建和部署后优化提供了一条路径。
查看原文
查看缓存全文

缓存时间: 2026/07/15 16:20

论文页面 - Signals:面向智能体交互的轨迹采样与分流

来源:https://huggingface.co/papers/2604.00356
发布于4月1日

·

由https://huggingface.co/parachas

Salman (https://huggingface.co/parachas) 于4月3日提交

摘要

一种基于信号的高效框架,通过计算低成本指标来识别信息丰富的样本,从而对智能体交互轨迹进行分流,同时不影响在线智能体的行为。

基于大型语言模型(https://huggingface.co/papers?q=large%20language%20models)的智能体应用(https://huggingface.co/papers?q=Agentic%20applications)日益依赖于涉及规划(https://huggingface.co/papers?q=planning)、动作执行(https://huggingface.co/papers?q=action%20execution)和环境反馈(https://huggingface.co/papers?q=environment%20feedback)的多步交互循环(https://huggingface.co/papers?q=multi-step%20interaction%20loops)。尽管此类系统现已大规模部署,但部署后的改进仍具挑战性。智能体轨迹数量庞大且非确定性,逐一审查(无论通过人工审核还是辅助LLM)都速度缓慢且成本高昂。我们提出一种轻量级的、基于信号的框架,用于对智能体交互轨迹进行分流。该方法从实时交互中计算廉价且广泛适用的信号,并将其作为结构化属性附加到轨迹分流(https://huggingface.co/papers?q=trajectory%20triage)中,从而识别可能信息丰富的交互,且不影响在线智能体的行为。我们将信号组织成一个粗粒度的分类体系,涵盖交互(错位、停滞、脱离、满意)、执行(失败、循环)和环境(耗尽)三类信号,这些信号设计为无需模型调用即可计算。在 τ-bench(一个广泛使用的工具增强型智能体评估基准)上进行的一项受控标注研究中,我们发现基于信号采样(https://huggingface.co/papers?q=signal-based%20sampling)的信息率达到82%,相比之下,启发式过滤(https://huggingface.co/papers?q=heuristic%20filtering)为74%,随机采样(https://huggingface.co/papers?q=random%20sampling)为54%,且每个信息轨迹的效率提升了1.52倍。该优势在奖励层级(https://huggingface.co/papers?q=reward%20strata)和任务领域(https://huggingface.co/papers?q=task%20domains)上均表现稳健,证实了信号能够带来真实的每条轨迹信息量增益,而不仅仅是过度采样明显的失败案例。这些结果表明,轻量级信号可作为智能体系统实用的采样基础设施,并为偏好数据构建(https://huggingface.co/papers?q=preference%20data%20construction)和部署后优化(https://huggingface.co/papers?q=post-deployment%20optimization)指明了一条道路。

查看 arXiv 页面 (https://arxiv.org/abs/2604.00356)
查看 PDF (https://arxiv.org/pdf/2604.00356)
项目页面 (https://planoai.dev/)
GitHub 6.86k (https://github.com/katanemo/plano)
添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.00356)

在您的智能体中获取此论文:

hf papers read 2604.00356

没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2604.00356,以便从此页面链接。

引用此论文的数据集 0

暂无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2604.00356,以便从此页面链接。

引用此论文的 Space 0

暂无 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2604.00356,以便从此页面链接。

包含此论文的收藏集 1

相似文章

离线偏好轨迹评估

arXiv cs.LG

本文提出了一种针对智能体系统的离线偏好轨迹评估方法,通过时间偏好而非二元成功指标来比较轨迹。研究表明,该方法将平局比例从约75%降低到35%,从而提升了跨多样化基准的区分能力和数据效率。