language-agents

标签

Cards List
#language-agents

AQuA:递归自我改进的量化交易研究智能体

arXiv cs.CL · 4天前 缓存

AQuA 是一个研究系统,包含两个独立的语言模型驱动智能体,它们在量化交易研究中递归地自我改进,在加密货币和美国股票上取得了较强的信息系数,同时使用密封沙箱防止数据泄漏。

0 人收藏 0 人点赞
#language-agents

Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction

arXiv cs.CL · 5天前 缓存

This paper introduces DARC, a diagnosis-guided recovery harness that makes agent self-correction selective by profiling failure modes and pruning mismatched interventions before test-time correction, improving performance on ALFWorld, AppWorld, and XBRL Finance.

0 人收藏 0 人点赞
#language-agents

EvoGraph-Mem:面向长期语言代理的失败感知可编辑图记忆

arXiv cs.AI · 5天前 缓存

提出了 EvoGraph-Mem,一种用于长期语言代理的失败感知可编辑图记忆框架,该框架跟踪正面/负面证据和激活状态以获取洞察,通过基于效用的检索和图级编辑实现记忆维护。

0 人收藏 0 人点赞
#language-agents

Search-G1:通过基于表示的内部奖励实现有依据的搜索代理

arXiv cs.CL · 2026-08-11 缓存

Search-G1提出了一种面向搜索增强语言代理的基于表示的内部奖励框架,利用干预校准的读出机制来平衡检索必要性与证据依赖,从而在无需昂贵标注的情况下提高搜索效率。

0 人收藏 0 人点赞
#language-agents

ContextWeave:一个真实世界的工作流基准

arXiv cs.AI · 2026-08-06 缓存

ContextWeave 是一个新的纵向基准,用于评估在现实办公工作流中,回忆的记忆是否能够提升下游智能体的性能。它利用 14 名参与者经过隐私保护的多月工作流,创建了 1,005 个可执行任务。

0 人收藏 0 人点赞
#language-agents

社会模拟中语言模型的角色引导

arXiv cs.CL · 2026-08-04 缓存

介绍了一种用于社会模拟中角色条件化LLM智能体的激活引导筛选工作流,在OLMo-3-7B-Instruct上对275个角色清单进行了评估,结果显示角色特定方向优于助手轴方向控制。

0 人收藏 0 人点赞
#language-agents

搜索、检查、获取:利用布尔检索赋能深度研究智能体

Hugging Face Daily Papers · 2026-08-03 缓存

本文介绍了SIEVE,一种搜索-检查-获取策略,利用布尔查询语言使深度研究智能体仅检索相关文档片段,在多个基准数据集和智能体主干上,以节省20.7%-50.6%的令牌数实现了更高准确性。

0 人收藏 0 人点赞
#language-agents

SKT:通过验证合成数据生成实现规模化技能使用训练

Hugging Face Daily Papers · 2026-08-03 缓存

介绍了SKT,一个用于语言模型智能体技能使用训练的验证数据合成流水线,从2,000个公开技能中生成4,000个任务包和27,164条经验证的轨迹。在SKT生成的轨迹上进行监督微调,能够持续提升不同模型和智能体框架的技能使用性能。

0 人收藏 0 人点赞
#language-agents

Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance

arXiv cs.LG · 2026-07-31 缓存

This position paper argues that long-horizon benchmark failures must be compared against baselines built from matched short stages, introducing the 'horizon residual' metric to distinguish task size from task difficulty in LLM agent evaluation.

0 人收藏 0 人点赞
#language-agents

从智能体失败到文本策略:有效与失效之处

arXiv cs.CL · 2026-07-24 缓存

本文探讨了基于文本的优化(TextGrad)为何在语言智能体上失败,表明虽然冻结的智能体能够遵循良好的策略,但它们无法可靠地从自身的轨迹中学习和选择策略。

0 人收藏 0 人点赞
#language-agents

RF-Agent:用于RFIC设计的语言智能体构建实用框架

arXiv cs.CL · 2026-07-22 缓存

RF-Agent引入了一种基于教科书的知识蒸馏流水线,创建了首个射频领域推理数据集和基准测试,证明了领域特定微调和语义检索能显著提升大语言模型在射频电路设计中的推理能力。

0 人收藏 0 人点赞
#language-agents

新LLM协调基准 - 在语言智能体中评估开放式多智能体协调 [R]

Reddit r/MachineLearning · 2026-07-14

介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。

0 人收藏 0 人点赞
#language-agents

RIMRULE: 通过MDL引导的规则学习改进工具使用语言代理

arXiv cs.CL · 2026-07-09 缓存

RimRule提出了一种神经符号方法,利用最小描述长度原则从失败轨迹中提炼出紧凑、可解释的规则,在不修改权重的情况下提升LLM工具使用性能,并展示了规则在模型间的可迁移性。

0 人收藏 0 人点赞
#language-agents

TurnOPD: 使在线策略蒸馏对回合感知以实现高效长程智能体训练

arXiv cs.AI · 2026-07-08 缓存

TurnOPD 引入了回合级别的预算机制用于长程智能体的在线策略蒸馏,通过自适应 rollout 深度和渐进式回合归一化损失预算解决了传统 OPD 的低效问题,在相同训练预算下实现了更高的准确性。

0 人收藏 0 人点赞
#language-agents

循环中的记忆:进程内检索作为语言智能体的扩展工作记忆

arXiv cs.AI · 2026-07-08 缓存

本文介绍了“循环中的记忆”,其中语言智能体在每个推理步骤中反复访问进程内关联存储。通过使用快速(约100微秒)的进程内存储,每一步的检索成本相比网络存储降低了三个数量级,消除了冗余操作,并提升了GPT-5类模型的召回率。

0 人收藏 0 人点赞
#language-agents

世界模型塌缩作为一种相变

arXiv cs.AI · 2026-07-01 缓存

研究语言智能体在长期任务中世界模型塌缩的相变现象,发现状态负载和依赖密度等参数在临界点附近导致模型突然崩溃,而非逐渐退化。

0 人收藏 0 人点赞
#language-agents

是什么驱动了反馈带来的交互式改进?

arXiv cs.AI · 2026-07-01 缓存

本文研究了在多轮语言智能体场景中,自然语言反馈带来的改进是否超越了仅靠反复尝试所取得的提升。通过跨多个基准测试的受控学生-教师协议,作者发现自我生成的反馈几乎没有额外增益,而强大的外部教师则能带来显著更大的提升,并且学生根据反馈采取行动的能力是关键瓶颈。

0 人收藏 0 人点赞
#language-agents

ATOD:面向多轮自主智能体的退火轮次感知在线策略蒸馏

arXiv cs.AI · 2026-06-29 缓存

本文介绍了ATOD,一种结合在线策略蒸馏和强化学习的混合在线蒸馏算法,用于在多轮任务中训练小型语言模型智能体,其特点是采用退火OPD-RL调度和轮次级分歧-不确定性重新加权,以改善密集监督。

0 人收藏 0 人点赞
#language-agents

基于迭代语言规划:参数化世界模型如何减少LLM代理中的幻觉传播

arXiv cs.AI · 2026-06-29 缓存

本文介绍了基于迭代语言规划(GILP),一种将小型参数化世界模型与基于LLM的推理相结合的方法,以减少LLM代理中的幻觉传播。实验表明,在图结构规划基准上,GILP将幻觉状态率从0.176降低到0.035,并将任务成功率从0.668提高到0.838。

0 人收藏 0 人点赞
#language-agents

OPID:面向智能体强化学习的在线策略技能蒸馏

arXiv cs.CL · 2026-06-26 缓存

OPID 是一个框架,它从完成的在线策略轨迹中提取密集的词元级监督信号,用于语言智能体的强化学习,通过分层技能(情节级和步骤级)来提高样本效率和鲁棒性。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈