long-horizon

标签

Cards List
#long-horizon

EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架

arXiv cs.LG · 2天前 缓存

介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。

0 人收藏 0 人点赞
#long-horizon

SearchAuditor:长时程搜索智能体故障的审计与归因

arXiv cs.AI · 2天前 缓存

本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。

0 人收藏 0 人点赞
#long-horizon

ABSeeker:通过答案回溯信用分配训练长时程搜索智能体

arXiv cs.AI · 3天前 缓存

本文提出答案回溯信用分配(ABC)框架,该框架将稀疏的轨迹级结果转换为密集的步级监督,用于训练长时程搜索智能体。所得到的ABSeeker模型基于Qwen3.5-4B构建,在BrowseComp基准上取得了强劲的结果,优于同规模智能体,并与更大规模的模型相当。

0 人收藏 0 人点赞
#long-horizon

ContextWeave:一个真实世界的工作流基准

arXiv cs.AI · 3天前 缓存

ContextWeave 是一个新的纵向基准,用于评估在现实办公工作流中,回忆的记忆是否能够提升下游智能体的性能。它利用 14 名参与者经过隐私保护的多月工作流,创建了 1,005 个可执行任务。

0 人收藏 0 人点赞
#long-horizon

@Saboo_Shubham_:Long Horizon in Action(附带酷炫 UI)而且当然也是开源的。

X AI KOLs Following · 3天前 缓存

一条推文,宣布了一个名为 'Long Horizon in Action' 的开源项目,该项目包含用户界面,很可能用于演示长程 AI 智能体的能力。

0 人收藏 0 人点赞
#long-horizon

@Saboo_Shubham_: 我们刚刚开源了一个模板,用于构建你自己的长周期智能体框架。这个智能体框架可以在后台做梦并自我改进…

X AI KOLs Following · 3天前 缓存

Saboo Shubham 宣布开源了一个模板,用于构建能够在后台做梦和自我改进的长周期智能体框架。

0 人收藏 0 人点赞
#long-horizon

Crayotter:通过组相对偏好反向传播学习长视界视频编辑智能体

arXiv cs.CL · 4天前 缓存

Crayotter 引入了组相对偏好反向传播(GRPB),一种训练长视界视频编辑智能体的方法,利用任务内偏好排序而非全局标量奖励。由此产生的 9B 模型在 AgenticVBench 上超越了多个专有系统。

0 人收藏 0 人点赞
#long-horizon

长时程终端任务的递归合成

Hugging Face Daily Papers · 4天前 缓存

本文介绍了递归合成终端任务(RST),一种递归验证的合成框架,用于大规模生成长时程终端智能体训练数据,共生成37,484个任务,并在终端基准上提升了Qwen3.5模型的表现。

0 人收藏 0 人点赞
#long-horizon

迈向技能原生的大语言模型:用于长程推理基准测试与训练的技能熵

Hugging Face Daily Papers · 4天前 缓存

本文介绍了技能熵(Skill Entropy),一种衡量跨技能切换难度的指标,以及 Skill^2-Bench,一个覆盖 558 项技能的长程推理任务基准。作者还提出了 Skill-EntropyRL,一个训练框架,将 Qwen3 模型上的推理性能从 34.4% 提升到 68.4%,并从 14.6% 提升到 40.1%。

0 人收藏 0 人点赞
#long-horizon

WorldCycle:面向长视界视频世界模型的自验证强化学习

Hugging Face Daily Papers · 4天前 缓存

WorldCycle提出了一种面向长视界视频世界模型的自验证强化学习方法,利用可逆动作循环作为免费监督,将状态回归漂移降低最多44%,并将复合动作准确率提升近4倍。它还引入了CycleBench,以评估作为模拟器的世界模型。

0 人收藏 0 人点赞
#long-horizon

OneDayAgent:迈向自主智能体的长时程执行框架

Hugging Face Daily Papers · 5天前 缓存

OneDayAgent 是一个面向自主智能体的长时程执行框架,它将开放式任务分解为有界子任务,在上下文压力下管理执行记忆,并验证/修复最终输出。它在 AgentIF-OneDay 上使用 GLM-5.2 达到了当前最优水平,并能泛化到五个后端 LLM。

0 人收藏 0 人点赞
#long-horizon

MirrorCode(8分钟阅读)

TLDR AI · 5天前 缓存

Epoch AI 和 METR 推出了 MirrorCode,这是一个基准测试,用于测试 AI 模型在长时间跨度内端到端重新实现整个程序的能力。早期结果显示,Claude Opus 4.7 在 14 小时内解决了一个生物信息学工具包,花费 251 美元,但记忆化方面的注意事项仍然存在。

0 人收藏 0 人点赞
#long-horizon

HERO:面向长时程自回归神经算子的历史增强展开训练

arXiv cs.LG · 6天前 缓存

本文提出HERO(历史增强展开训练),一种通过模型自身优化历史的相对监督来增强自回归神经算子的标准轨迹监督的方法,提高了PDE基准上的长时程精度和稳定性。

0 人收藏 0 人点赞
#long-horizon

最好的朋友,并非永远:评估AI伴侣中的长期角色崩塌与行为漂移

arXiv cs.AI · 6天前 缓存

本文介绍了Anchor,一个用于评估AI伴侣中长期角色稳定性与轨迹记忆的合成审计框架,发现当前模型在长时间交互中无法可靠地保持身份与记忆。

0 人收藏 0 人点赞
#long-horizon

ThinkReset:面向有限上下文长程推理的可学习中间接口构建

arXiv cs.AI · 6天前 缓存

本文提出ThinkReset方法,通过构建可复用的中间接口来替代被丢弃的推理历史,从而在受限上下文窗口下实现更好的长程推理。

0 人收藏 0 人点赞
#long-horizon

LongHorizon-Harness:推进面向真实世界任务的长时程智能体

Hugging Face Daily Papers · 6天前 缓存

介绍了LongHorizon-Harness,一种面向长时程LLM智能体的任务状态管理方法,采用Manage-Execute-Audit循环,在WeaveBench和OSWorld等多个模型和基准上展示了一致的改进。

0 人收藏 0 人点赞
#long-horizon

DeepVoyager-VL:激励长时程多模态智能体的视觉在环搜索

Hugging Face Daily Papers · 6天前 缓存

DeepVoyager-VL 提出了一种长时程多模态深度搜索框架,将视觉证据融入中间推理过程,利用多模态事件图进行数据合成和微调,而无需强化学习,在十个基准测试上取得了强劲性能。

0 人收藏 0 人点赞
#long-horizon

RRM:经验驱动的反思性检索记忆用于长时程多模态推理

arXiv cs.CL · 2026-07-31 缓存

本文介绍了反思性检索记忆(RRM),一种记忆框架,从历史任务轨迹中提炼程序性检索经验,以改进长时程多模态推理中的证据检索。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long基准上达到或超过了先前的最先进水平。

0 人收藏 0 人点赞
#long-horizon

Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance

arXiv cs.LG · 2026-07-31 缓存

This position paper argues that long-horizon benchmark failures must be compared against baselines built from matched short stages, introducing the 'horizon residual' metric to distinguish task size from task difficulty in LLM agent evaluation.

0 人收藏 0 人点赞
#long-horizon

CAST: 游戏求解器作为LLM智能体的回合级教师

arXiv cs.CL · 2026-07-29 缓存

CAST是一种方法,利用游戏求解器的状态值来提供回合级信用分配信号,通过强化学习训练LLM智能体,在多个游戏中的领域内和未见难度评估中均优于基线。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈