language-agents

标签

Cards List
#language-agents

长时程语言智能体中的重尾记忆轨迹

arXiv cs.AI ↗ · 昨天 缓存

该论文对长时程语言智能体的记忆使用模式进行了审计,发现其检索轨迹呈现重尾(核心-尾部)分布,并提出了 Core-Tail World Model(CTWM)——一种基于排序的记忆控制器。在 LongMemEval 上,该控制器在保持准确率不变的情况下,最多可将提示词 token 数削减 24.48%。

0 人收藏 0 人点赞
#language-agents

NAQD Env:面向语言智能体选择性退出的基准测试

arXiv cs.AI ↗ · 2天前 缓存

NAQD-Env 是一个合成基准测试,用于评估语言智能体在证据、权限或停止指令发生变化时如何有选择地暂停行动。研究发现,尽管微调能提升决策准确性,但各模型的选择性退出召回率仍接近于零。

0 人收藏 0 人点赞
#language-agents

RideWay: 工具使用语言代理的高效任务完成基准测试

arXiv cs.AI ↗ · 2026-09-17 缓存

RideWay提出了一个以效率为核心的基准测试和Efficiency Utility指标,用于评估打车任务中工具使用语言代理的性能,基于工具调用和用户交互轮次来衡量成功差距表现。

0 人收藏 0 人点赞
#language-agents

智能体应该忘记什么?区分存储内容与使用内容

arXiv cs.AI ↗ · 2026-09-11 缓存

本文介绍了RD-Forget,这是一个无需训练的持久化语言智能体框架,通过分离存储记忆与查询条件证据来处理事实变化,同时保留历史信息。

0 人收藏 0 人点赞
#language-agents

变化下的程序性记忆:受控网络任务中的重用与干扰

arXiv cs.AI ↗ · 2026-09-11 缓存

本研究探讨了语言代理中程序性记忆不匹配如何影响网络任务,发现在受控条件下,不匹配不会导致行为中断或错误。

0 人收藏 0 人点赞
#language-agents

ContractEval:查询条件下的执行匹配与过程指令符合性评估

arXiv cs.AI ↗ · 2026-09-11 缓存

ContractEval是一个诊断框架,用于评估LLM代理中的过程符合性,通过明确化活跃义务并与证据进行匹配,检测传统评判者遗漏的失败。

0 人收藏 0 人点赞
#language-agents

结果监控器:静默工具故障的恢复能力

arXiv cs.AI ↗ · 2026-08-21 缓存

本文介绍了结果监控器,这是一种确定性检测器,用于识别语言代理工具调用中的静默故障并提供恢复收据,显著提高了ToolMaze和τ-bench等基准测试中的任务完成率。

0 人收藏 0 人点赞
#language-agents

AQuA:递归自我改进的量化交易研究智能体

arXiv cs.CL ↗ · 2026-08-14 缓存

AQuA 是一个研究系统,包含两个独立的语言模型驱动智能体,它们在量化交易研究中递归地自我改进,在加密货币和美国股票上取得了较强的信息系数,同时使用密封沙箱防止数据泄漏。

0 人收藏 0 人点赞
#language-agents

Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction

arXiv cs.CL ↗ · 2026-08-13 缓存

This paper introduces DARC, a diagnosis-guided recovery harness that makes agent self-correction selective by profiling failure modes and pruning mismatched interventions before test-time correction, improving performance on ALFWorld, AppWorld, and XBRL Finance.

0 人收藏 0 人点赞
#language-agents

EvoGraph-Mem:面向长期语言代理的失败感知可编辑图记忆

arXiv cs.AI ↗ · 2026-08-13 缓存

提出了 EvoGraph-Mem,一种用于长期语言代理的失败感知可编辑图记忆框架,该框架跟踪正面/负面证据和激活状态以获取洞察,通过基于效用的检索和图级编辑实现记忆维护。

0 人收藏 0 人点赞
#language-agents

Search-G1:通过基于表示的内部奖励实现有依据的搜索代理

arXiv cs.CL ↗ · 2026-08-11 缓存

Search-G1提出了一种面向搜索增强语言代理的基于表示的内部奖励框架,利用干预校准的读出机制来平衡检索必要性与证据依赖,从而在无需昂贵标注的情况下提高搜索效率。

0 人收藏 0 人点赞
#language-agents

ContextWeave:一个真实世界的工作流基准

arXiv cs.AI ↗ · 2026-08-06 缓存

ContextWeave 是一个新的纵向基准,用于评估在现实办公工作流中,回忆的记忆是否能够提升下游智能体的性能。它利用 14 名参与者经过隐私保护的多月工作流,创建了 1,005 个可执行任务。

0 人收藏 0 人点赞
#language-agents

社会模拟中语言模型的角色引导

arXiv cs.CL ↗ · 2026-08-04 缓存

介绍了一种用于社会模拟中角色条件化LLM智能体的激活引导筛选工作流,在OLMo-3-7B-Instruct上对275个角色清单进行了评估,结果显示角色特定方向优于助手轴方向控制。

0 人收藏 0 人点赞
#language-agents

搜索、检查、获取:利用布尔检索赋能深度研究智能体

Hugging Face Daily Papers ↗ · 2026-08-03 缓存

本文介绍了SIEVE,一种搜索-检查-获取策略,利用布尔查询语言使深度研究智能体仅检索相关文档片段,在多个基准数据集和智能体主干上,以节省20.7%-50.6%的令牌数实现了更高准确性。

0 人收藏 0 人点赞
#language-agents

SKT:通过验证合成数据生成实现规模化技能使用训练

Hugging Face Daily Papers ↗ · 2026-08-03 缓存

介绍了SKT,一个用于语言模型智能体技能使用训练的验证数据合成流水线,从2,000个公开技能中生成4,000个任务包和27,164条经验证的轨迹。在SKT生成的轨迹上进行监督微调,能够持续提升不同模型和智能体框架的技能使用性能。

0 人收藏 0 人点赞
#language-agents

Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance

arXiv cs.LG ↗ · 2026-07-31 缓存

This position paper argues that long-horizon benchmark failures must be compared against baselines built from matched short stages, introducing the 'horizon residual' metric to distinguish task size from task difficulty in LLM agent evaluation.

0 人收藏 0 人点赞
#language-agents

从智能体失败到文本策略:有效与失效之处

arXiv cs.CL ↗ · 2026-07-24 缓存

本文探讨了基于文本的优化(TextGrad)为何在语言智能体上失败,表明虽然冻结的智能体能够遵循良好的策略,但它们无法可靠地从自身的轨迹中学习和选择策略。

0 人收藏 0 人点赞
#language-agents

RF-Agent:用于RFIC设计的语言智能体构建实用框架

arXiv cs.CL ↗ · 2026-07-22 缓存

RF-Agent引入了一种基于教科书的知识蒸馏流水线,创建了首个射频领域推理数据集和基准测试,证明了领域特定微调和语义检索能显著提升大语言模型在射频电路设计中的推理能力。

0 人收藏 0 人点赞
#language-agents

新LLM协调基准 - 在语言智能体中评估开放式多智能体协调 [R]

Reddit r/MachineLearning ↗ · 2026-07-14

介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。

0 人收藏 0 人点赞
#language-agents

RIMRULE: 通过MDL引导的规则学习改进工具使用语言代理

arXiv cs.CL ↗ · 2026-07-09 缓存

RimRule提出了一种神经符号方法,利用最小描述长度原则从失败轨迹中提炼出紧凑、可解释的规则,在不修改权重的情况下提升LLM工具使用性能,并展示了规则在模型间的可迁移性。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈