long-horizon-tasks

标签

Cards List
#long-horizon-tasks

长时运行的Agent:瓶颈究竟是模型还是其周围的脚手架?

Reddit r/artificial ↗ · 1小时前

一场从业者讨论,探讨长时运行的AI Agent故障究竟源于模型能力还是其周围的脚手架,重点分析了错误累积、上下文污染和自我修正薄弱这几种关键故障模式。

0 人收藏 0 人点赞
#long-horizon-tasks

面向目标条件强化学习的多时间尺度学习方法

arXiv cs.AI ↗ · 3天前 缓存

论文提出了 Generalized Implicit Temporal Abstraction(GITA),这是一种用于离线目标条件强化学习的方法,在多个时间抽象尺度上训练单个 k 条件价值函数,从而解决了长程价值信号与局部分辨率之间的权衡问题。GITA 在 OGBench 上超越了 HIQL 和 OTA 等离线 GCRL 基线方法,相比 HIQL 将平均成功率提升了 25 个百分点。

0 人收藏 0 人点赞
#long-horizon-tasks

VeriHarness:扩展长时程任务的智能体验证能力

Hugging Face Daily Papers ↗ · 4天前 缓存

VeriHarness 将 LLM 生成器转变为智能体式验证器——为其配备工作区、证据工具、可复用的验证技能、分歧消解器和共识挑战器——从而在没有参考答案的情况下,为长时程任务筛选可靠输出。在五个基准测试中,它取得了最高的选择得分,使用 Gemini 3.5 Flash 和 Claude Opus 4.8 分别比单次采样提升 6.2 至 6.4 个点,并发布了约 26,000 次采样结果,成本超过 100,000 美元。

0 人收藏 0 人点赞
#long-horizon-tasks

MILO:通过多智能体协同进化实现自动化 Harness 发现

Hugging Face Daily Papers ↗ · 6天前 缓存

论文提出了 MILO,一个让智能体 harness 与用于发现它们的搜索策略协同进化的框架,采用基于岛屿的进化搜索,并结合变异体智能体与协调器。在 Terminal-Bench 2.1、PaperBench 和 DeepSWE 上,MILO 发现的 harness 优于最前沿的 harness 和搜索方法,甚至超越了 Terminal-Bench 2.1 排行榜的榜首条目,且 token 消耗减少 26%。

0 人收藏 0 人点赞
#long-horizon-tasks

搜索之后才是难题:评估网络代理在知识合成、组织和展示上的表现

arXiv cs.CL ↗ · 2026-09-28 缓存

论文介绍了KNOWS基准,用于评估网络代理在涉及将知识合成为和组织成制品的复杂长期任务时的表现,揭示了当前代理在视觉步骤和长期推理方面存在困难。

0 人收藏 0 人点赞
#long-horizon-tasks

BIABench:在真实生物图像分析任务上评估AI智能体

Hugging Face Daily Papers ↗ · 2026-09-28 缓存

论文提出了BIABench,一个从已发表研究中重建的、包含16项真实生物图像分析任务的开放基准,对AI智能体进行端到端评估,采用结果评分和过程评分两种方式。智能体能够很好地解决常规二维任务,但在三维和延时序列任务上表现失败;无论是生物领域专业化、更强的模型,还是专家撰写的详细指令,都无法弥合这一可靠性差距。

0 人收藏 0 人点赞
#long-horizon-tasks

StructRL: 长周期视觉-语言-动作任务的在线结构化强化学习

Hugging Face Daily Papers ↗ · 2026-09-28 缓存

StructRL 引入了一个在线强化学习框架,该框架使用来自可验证子任务的结构化中间奖励,以增强长周期视觉-语言-动作任务,在 RoboCasa365 和 LIBERO-Long 等基准测试中展示了卓越性能。

0 人收藏 0 人点赞
#long-horizon-tasks

Marathoner:超长时间范围自主智能

Hugging Face Daily Papers ↗ · 2026-09-28 缓存

本文提出了Marathoner,一个用于超长时间范围执行的自主代理模型,使用一个全面的后训练管道,任务从GitHub PR合成,并采用一种新颖的奖励策略,以在基准测试中实现卓越性能。

0 人收藏 0 人点赞
#long-horizon-tasks

@giohuh_: 当Astra被赋予类人身体时能做什么?我们构建了HomeBody来探究。由GPT Astra控制,它能够执行…

X AI KOLs Timeline ↗ · 2026-09-26 缓存

HomeBody是一款由GPT Astra控制的类人机器人,它探索未知环境,构建数字孪生体,并执行长期任务,如整理和检索物体,无需特定环境训练。

0 人收藏 0 人点赞
#long-horizon-tasks

成功源于绕行:为长期智能体学习可执行演练

arXiv cs.LG ↗ · 2026-09-22 缓存

本文介绍了Trace,一个信用引导框架,它将噪声交互历史编译为可执行演练,以提升长期AI智能体的性能,在实验中显示出显著改进。

0 人收藏 0 人点赞
#long-horizon-tasks

品味代理:长期任务中品味的衡量与提升

Hugging Face Daily Papers ↗ · 2026-09-22 缓存

本文介绍了 Taste-Bench,一个用于衡量 LLM 代理长期决策品味的基准,发现前沿模型准确率较低,且品味可通过蒸馏训练提升。

0 人收藏 0 人点赞
#long-horizon-tasks

根因归因是一个搜索问题:针对长期代理失败的持续搜索

arXiv cs.AI ↗ · 2026-09-15 缓存

本文介绍了持续搜索(Continual Search),这是一个迭代框架,通过在长期执行痕迹中搜索诊断证据来增强AI代理失败的根因归因,并在包括MegaRCA-Mix在内的基准测试中进行评估,显示出显著的性能提升。

0 人收藏 0 人点赞
#long-horizon-tasks

面向长期LLM智能体强化学习的粒度自适应信用分配

arXiv cs.LG ↗ · 2026-09-14 缓存

本文提出了GACA,一种粒度自适应的信用分配方法,用于长期LLM智能体强化学习,通过适应分辨率到步骤重要性来提高任务成功率。

0 人收藏 0 人点赞
#long-horizon-tasks

子代理与代理技能:为长期代理任务执行可重用知识

arXiv cs.AI ↗ · 2026-09-11 缓存

本文比较了语言模型代理中长期任务的子代理执行与代理技能执行,发现当技能定义良好时,子代理执行表现更优,尽管它增加了通信开销。

0 人收藏 0 人点赞
#long-horizon-tasks

Progressive Point Matching (8分钟阅读)

TLDR AI ↗ · 2026-09-09 缓存

Progressive Point Matching (PPM) 是一个提出的框架,用于在强化学习中为 LLMs 的长期任务分配部分信用,通过将推理视为马尔可夫状态空间中的路径来解决稀疏结果奖励的低效性。

0 人收藏 0 人点赞
#long-horizon-tasks

环境作为支架:丰富反馈以引导长期任务中的自我进化智能体

Hugging Face Daily Papers ↗ · 2026-09-08 缓存

本文提出了反馈丰富环境(FEEs),通过丰富强化学习的反馈来引导长期任务中的自我进化智能体,并在使用Qwen3模型和RL算法的基准测试中显示了稳定性和性能的提升。

0 人收藏 0 人点赞
#long-horizon-tasks

TIGPO:用于长视域LLM智能体的时间实例图策略优化

arXiv cs.LG ↗ · 2026-09-04 缓存

TIGPO提出了一种时间实例图策略优化方法,通过持久转移图和重访槽,扩展了基于图的信用分配跨策略更新,用于长视域LLM智能体,以改善优势估计和在ALFWorld和WebShop等基准测试上的性能。

0 人收藏 0 人点赞
#long-horizon-tasks

多行动,少决策:技能引导的自适应动作分块用于长期任务LLM代理

arXiv cs.LG ↗ · 2026-09-03 缓存

本文提出'Space',一种技能引导的自适应动作分块方法,用于长期任务LLM代理,将成功率提高7.0%–31.3%,并将LLM决策轮次减少高达78.9%。

0 人收藏 0 人点赞
#long-horizon-tasks

SkillGLoW:用于长时任务流中自我改进代理的程序族技能整合

arXiv cs.AI ↗ · 2026-09-03 缓存

SkillGLoW 是一种用于LLM代理的方法,它将技能组织成程序族,以增强在长时任务上的自我改进,相比基线展示了显著的性能提升。

0 人收藏 0 人点赞
#long-horizon-tasks

E-Commerce Bench:针对长期自主业务运营的LLM代理评估基准

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

E-Commerce Bench是一个开源基准,用于评估LLM代理在电子商务中长期自主业务运营的能力,特色包括多店铺谈判和模拟一年内的动态事件。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈