标签
该论文对长时程语言智能体的记忆使用模式进行了审计,发现其检索轨迹呈现重尾(核心-尾部)分布,并提出了 Core-Tail World Model(CTWM)——一种基于排序的记忆控制器。在 LongMemEval 上,该控制器在保持准确率不变的情况下,最多可将提示词 token 数削减 24.48%。
NAQD-Env 是一个合成基准测试,用于评估语言智能体在证据、权限或停止指令发生变化时如何有选择地暂停行动。研究发现,尽管微调能提升决策准确性,但各模型的选择性退出召回率仍接近于零。
RideWay提出了一个以效率为核心的基准测试和Efficiency Utility指标,用于评估打车任务中工具使用语言代理的性能,基于工具调用和用户交互轮次来衡量成功差距表现。
本文介绍了RD-Forget,这是一个无需训练的持久化语言智能体框架,通过分离存储记忆与查询条件证据来处理事实变化,同时保留历史信息。
本研究探讨了语言代理中程序性记忆不匹配如何影响网络任务,发现在受控条件下,不匹配不会导致行为中断或错误。
ContractEval是一个诊断框架,用于评估LLM代理中的过程符合性,通过明确化活跃义务并与证据进行匹配,检测传统评判者遗漏的失败。
本文介绍了结果监控器,这是一种确定性检测器,用于识别语言代理工具调用中的静默故障并提供恢复收据,显著提高了ToolMaze和τ-bench等基准测试中的任务完成率。
AQuA 是一个研究系统,包含两个独立的语言模型驱动智能体,它们在量化交易研究中递归地自我改进,在加密货币和美国股票上取得了较强的信息系数,同时使用密封沙箱防止数据泄漏。
This paper introduces DARC, a diagnosis-guided recovery harness that makes agent self-correction selective by profiling failure modes and pruning mismatched interventions before test-time correction, improving performance on ALFWorld, AppWorld, and XBRL Finance.
提出了 EvoGraph-Mem,一种用于长期语言代理的失败感知可编辑图记忆框架,该框架跟踪正面/负面证据和激活状态以获取洞察,通过基于效用的检索和图级编辑实现记忆维护。
Search-G1提出了一种面向搜索增强语言代理的基于表示的内部奖励框架,利用干预校准的读出机制来平衡检索必要性与证据依赖,从而在无需昂贵标注的情况下提高搜索效率。
ContextWeave 是一个新的纵向基准,用于评估在现实办公工作流中,回忆的记忆是否能够提升下游智能体的性能。它利用 14 名参与者经过隐私保护的多月工作流,创建了 1,005 个可执行任务。
介绍了一种用于社会模拟中角色条件化LLM智能体的激活引导筛选工作流,在OLMo-3-7B-Instruct上对275个角色清单进行了评估,结果显示角色特定方向优于助手轴方向控制。
本文介绍了SIEVE,一种搜索-检查-获取策略,利用布尔查询语言使深度研究智能体仅检索相关文档片段,在多个基准数据集和智能体主干上,以节省20.7%-50.6%的令牌数实现了更高准确性。
介绍了SKT,一个用于语言模型智能体技能使用训练的验证数据合成流水线,从2,000个公开技能中生成4,000个任务包和27,164条经验证的轨迹。在SKT生成的轨迹上进行监督微调,能够持续提升不同模型和智能体框架的技能使用性能。
This position paper argues that long-horizon benchmark failures must be compared against baselines built from matched short stages, introducing the 'horizon residual' metric to distinguish task size from task difficulty in LLM agent evaluation.
本文探讨了基于文本的优化(TextGrad)为何在语言智能体上失败,表明虽然冻结的智能体能够遵循良好的策略,但它们无法可靠地从自身的轨迹中学习和选择策略。
RF-Agent引入了一种基于教科书的知识蒸馏流水线,创建了首个射频领域推理数据集和基准测试,证明了领域特定微调和语义检索能显著提升大语言模型在射频电路设计中的推理能力。
介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。
RimRule提出了一种神经符号方法,利用最小描述长度原则从失败轨迹中提炼出紧凑、可解释的规则,在不修改权重的情况下提升LLM工具使用性能,并展示了规则在模型间的可迁移性。