信号:用于智能体交互的轨迹采样与分流
摘要
本文提出了一种轻量级的、基于信号的框架,通过计算低成本指标来高效分流智能体交互轨迹,这些指标能识别出信息丰富的样本,且不影响在线智能体行为,在基准测试上实现了82%的信息率。
查看缓存全文
缓存时间: 2026/07/15 16:20
论文页面 - Signals:面向智能体交互的轨迹采样与分流
来源:https://huggingface.co/papers/2604.00356
发布于4月1日
·
由https://huggingface.co/parachas
Salman (https://huggingface.co/parachas) 于4月3日提交
摘要
一种基于信号的高效框架,通过计算低成本指标来识别信息丰富的样本,从而对智能体交互轨迹进行分流,同时不影响在线智能体的行为。
基于大型语言模型(https://huggingface.co/papers?q=large%20language%20models)的智能体应用(https://huggingface.co/papers?q=Agentic%20applications)日益依赖于涉及规划(https://huggingface.co/papers?q=planning)、动作执行(https://huggingface.co/papers?q=action%20execution)和环境反馈(https://huggingface.co/papers?q=environment%20feedback)的多步交互循环(https://huggingface.co/papers?q=multi-step%20interaction%20loops)。尽管此类系统现已大规模部署,但部署后的改进仍具挑战性。智能体轨迹数量庞大且非确定性,逐一审查(无论通过人工审核还是辅助LLM)都速度缓慢且成本高昂。我们提出一种轻量级的、基于信号的框架,用于对智能体交互轨迹进行分流。该方法从实时交互中计算廉价且广泛适用的信号,并将其作为结构化属性附加到轨迹分流(https://huggingface.co/papers?q=trajectory%20triage)中,从而识别可能信息丰富的交互,且不影响在线智能体的行为。我们将信号组织成一个粗粒度的分类体系,涵盖交互(错位、停滞、脱离、满意)、执行(失败、循环)和环境(耗尽)三类信号,这些信号设计为无需模型调用即可计算。在 τ-bench(一个广泛使用的工具增强型智能体评估基准)上进行的一项受控标注研究中,我们发现基于信号采样(https://huggingface.co/papers?q=signal-based%20sampling)的信息率达到82%,相比之下,启发式过滤(https://huggingface.co/papers?q=heuristic%20filtering)为74%,随机采样(https://huggingface.co/papers?q=random%20sampling)为54%,且每个信息轨迹的效率提升了1.52倍。该优势在奖励层级(https://huggingface.co/papers?q=reward%20strata)和任务领域(https://huggingface.co/papers?q=task%20domains)上均表现稳健,证实了信号能够带来真实的每条轨迹信息量增益,而不仅仅是过度采样明显的失败案例。这些结果表明,轻量级信号可作为智能体系统实用的采样基础设施,并为偏好数据构建(https://huggingface.co/papers?q=preference%20data%20construction)和部署后优化(https://huggingface.co/papers?q=post-deployment%20optimization)指明了一条道路。
查看 arXiv 页面 (https://arxiv.org/abs/2604.00356)
查看 PDF (https://arxiv.org/pdf/2604.00356)
项目页面 (https://planoai.dev/)
GitHub 6.86k (https://github.com/katanemo/plano)
添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.00356)
在您的智能体中获取此论文:
hf papers read 2604.00356
没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
暂无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2604.00356,以便从此页面链接。
引用此论文的数据集 0
暂无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2604.00356,以便从此页面链接。
引用此论文的 Space 0
暂无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2604.00356,以便从此页面链接。
包含此论文的收藏集 1
相似文章
Signals:无需 LLM 评审即可找出最具信息量的智能体轨迹 [R]
Katanemo Labs 推出了 'Signals',这是一种轻量级方法,可在不使用 LLM 评审或 GPU 的情况下识别出具有高信息量的智能体轨迹,从而在轨迹分析中实现更高的效率。
离线偏好轨迹评估
本文提出了一种针对智能体系统的离线偏好轨迹评估方法,通过时间偏好而非二元成功指标来比较轨迹。研究表明,该方法将平局比例从约75%降低到35%,从而提升了跨多样化基准的区分能力和数据效率。
Agentic-Ideation:面向科学构想智能体的样本高效轨迹合成方法
提出了Agentic-Ideation框架,用于高效合成智能体轨迹以训练LLMs进行科学构想,实现了超过10倍的样本效率提升,并优于现有的基于工作流的基线方法。
TRACE:面向长周期智能体安全的轨迹风险感知压缩方法
本文提出 TRACE,一种面向长周期 LLM 智能体的轨迹级安全检测方法,通过将完整轨迹证据压缩为潜在状态,更好地聚合分散的风险信号,在多个基准上达到最先进的准确率。
TRACE:面向LLM智能体的自适应跨步证据聚合轨迹推理
TRACE是一个用于长周期LLM智能体轨迹的监控框架,它通过分诊-检查-判断(Triage-Inspect-Judge)循环来连接时间上相隔较远的动作证据,在规避性破坏检测任务上实现了高召回率和F1值。