标签
AQuA 是一个研究系统,包含两个独立的语言模型驱动智能体,它们在量化交易研究中递归地自我改进,在加密货币和美国股票上取得了较强的信息系数,同时使用密封沙箱防止数据泄漏。
This paper introduces DARC, a diagnosis-guided recovery harness that makes agent self-correction selective by profiling failure modes and pruning mismatched interventions before test-time correction, improving performance on ALFWorld, AppWorld, and XBRL Finance.
提出了 EvoGraph-Mem,一种用于长期语言代理的失败感知可编辑图记忆框架,该框架跟踪正面/负面证据和激活状态以获取洞察,通过基于效用的检索和图级编辑实现记忆维护。
Search-G1提出了一种面向搜索增强语言代理的基于表示的内部奖励框架,利用干预校准的读出机制来平衡检索必要性与证据依赖,从而在无需昂贵标注的情况下提高搜索效率。
ContextWeave 是一个新的纵向基准,用于评估在现实办公工作流中,回忆的记忆是否能够提升下游智能体的性能。它利用 14 名参与者经过隐私保护的多月工作流,创建了 1,005 个可执行任务。
介绍了一种用于社会模拟中角色条件化LLM智能体的激活引导筛选工作流,在OLMo-3-7B-Instruct上对275个角色清单进行了评估,结果显示角色特定方向优于助手轴方向控制。
本文介绍了SIEVE,一种搜索-检查-获取策略,利用布尔查询语言使深度研究智能体仅检索相关文档片段,在多个基准数据集和智能体主干上,以节省20.7%-50.6%的令牌数实现了更高准确性。
介绍了SKT,一个用于语言模型智能体技能使用训练的验证数据合成流水线,从2,000个公开技能中生成4,000个任务包和27,164条经验证的轨迹。在SKT生成的轨迹上进行监督微调,能够持续提升不同模型和智能体框架的技能使用性能。
This position paper argues that long-horizon benchmark failures must be compared against baselines built from matched short stages, introducing the 'horizon residual' metric to distinguish task size from task difficulty in LLM agent evaluation.
本文探讨了基于文本的优化(TextGrad)为何在语言智能体上失败,表明虽然冻结的智能体能够遵循良好的策略,但它们无法可靠地从自身的轨迹中学习和选择策略。
RF-Agent引入了一种基于教科书的知识蒸馏流水线,创建了首个射频领域推理数据集和基准测试,证明了领域特定微调和语义检索能显著提升大语言模型在射频电路设计中的推理能力。
介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。
RimRule提出了一种神经符号方法,利用最小描述长度原则从失败轨迹中提炼出紧凑、可解释的规则,在不修改权重的情况下提升LLM工具使用性能,并展示了规则在模型间的可迁移性。
TurnOPD 引入了回合级别的预算机制用于长程智能体的在线策略蒸馏,通过自适应 rollout 深度和渐进式回合归一化损失预算解决了传统 OPD 的低效问题,在相同训练预算下实现了更高的准确性。
本文介绍了“循环中的记忆”,其中语言智能体在每个推理步骤中反复访问进程内关联存储。通过使用快速(约100微秒)的进程内存储,每一步的检索成本相比网络存储降低了三个数量级,消除了冗余操作,并提升了GPT-5类模型的召回率。
研究语言智能体在长期任务中世界模型塌缩的相变现象,发现状态负载和依赖密度等参数在临界点附近导致模型突然崩溃,而非逐渐退化。
本文研究了在多轮语言智能体场景中,自然语言反馈带来的改进是否超越了仅靠反复尝试所取得的提升。通过跨多个基准测试的受控学生-教师协议,作者发现自我生成的反馈几乎没有额外增益,而强大的外部教师则能带来显著更大的提升,并且学生根据反馈采取行动的能力是关键瓶颈。
本文介绍了ATOD,一种结合在线策略蒸馏和强化学习的混合在线蒸馏算法,用于在多轮任务中训练小型语言模型智能体,其特点是采用退火OPD-RL调度和轮次级分歧-不确定性重新加权,以改善密集监督。
本文介绍了基于迭代语言规划(GILP),一种将小型参数化世界模型与基于LLM的推理相结合的方法,以减少LLM代理中的幻觉传播。实验表明,在图结构规划基准上,GILP将幻觉状态率从0.176降低到0.035,并将任务成功率从0.668提高到0.838。
OPID 是一个框架,它从完成的在线策略轨迹中提取密集的词元级监督信号,用于语言智能体的强化学习,通过分层技能(情节级和步骤级)来提高样本效率和鲁棒性。