long-horizon

标签

Cards List
#long-horizon

GraphThink:面向长时程具身任务规划的图增强LLM思维

arXiv cs.AI · 昨天 缓存

GraphThink 是一个将任务图与场景图相结合的框架,旨在增强基于LLM的长时程具身任务规划,在ALFRED基准上取得了最先进的结果,并提升了泛化能力和闭环重规划能力。

0 人收藏 0 人点赞
#long-horizon

VibeLifeBench:你的生活智能体能否在生活世界中主动且持续地行动?

Hugging Face Daily Papers · 昨天 缓存

介绍了VibeLifeBench,这是一个包含200个长周期任务、覆盖十个日常生活领域的基准测试,用于在模拟的多周生活世界中评估主动且持续的LLM智能体。当前前沿模型得分较低,凸显了现有智能体与现实生活辅助之间的差距。

0 人收藏 0 人点赞
#long-horizon

PHASE-Tree: Modeling Character-State Evolution in Long-Horizon Role-Playing Dialogue

arXiv cs.CL · 2天前 缓存

This paper introduces PHASE-Tree, a multi-timescale character-state representation for long-horizon role-playing dialogue, along with the LongEvoRoleBench benchmark to evaluate evolved-state generation. The proposed approach outperforms baselines on character-level, semantic, and embedding metrics across long-dialogue corpora.

0 人收藏 0 人点赞
#long-horizon

不值得再花一个Token:高效深度研究智能体的边际价值估计

Hugging Face Daily Papers · 3天前 缓存

本文对长时程深度研究智能体中减少Token使用和延迟的剪枝策略进行了系统性研究,表明早期剪枝能带来最大的效率提升,且质量损失很小。

0 人收藏 0 人点赞
#long-horizon

EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架

arXiv cs.LG · 5天前 缓存

介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。

0 人收藏 0 人点赞
#long-horizon

SearchAuditor:长时程搜索智能体故障的审计与归因

arXiv cs.AI · 5天前 缓存

本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。

0 人收藏 0 人点赞
#long-horizon

ABSeeker:通过答案回溯信用分配训练长时程搜索智能体

arXiv cs.AI · 6天前 缓存

本文提出答案回溯信用分配(ABC)框架,该框架将稀疏的轨迹级结果转换为密集的步级监督,用于训练长时程搜索智能体。所得到的ABSeeker模型基于Qwen3.5-4B构建,在BrowseComp基准上取得了强劲的结果,优于同规模智能体,并与更大规模的模型相当。

0 人收藏 0 人点赞
#long-horizon

ContextWeave:一个真实世界的工作流基准

arXiv cs.AI · 6天前 缓存

ContextWeave 是一个新的纵向基准,用于评估在现实办公工作流中,回忆的记忆是否能够提升下游智能体的性能。它利用 14 名参与者经过隐私保护的多月工作流,创建了 1,005 个可执行任务。

0 人收藏 0 人点赞
#long-horizon

@Saboo_Shubham_:Long Horizon in Action(附带酷炫 UI)而且当然也是开源的。

X AI KOLs Following · 6天前 缓存

一条推文,宣布了一个名为 'Long Horizon in Action' 的开源项目,该项目包含用户界面,很可能用于演示长程 AI 智能体的能力。

0 人收藏 0 人点赞
#long-horizon

@Saboo_Shubham_: 我们刚刚开源了一个模板,用于构建你自己的长周期智能体框架。这个智能体框架可以在后台做梦并自我改进…

X AI KOLs Following · 6天前 缓存

Saboo Shubham 宣布开源了一个模板,用于构建能够在后台做梦和自我改进的长周期智能体框架。

0 人收藏 0 人点赞
#long-horizon

StreamArena:迈向连续、交互式且长时程的智能体流式视频理解

Hugging Face Daily Papers · 6天前 缓存

StreamArena 是一个用于小时级交互式流式视频理解的基准测试,并配套了一种名为 StreamMind 的两层架构。该架构在实时感知、历史回顾、主动交互和工具使用方面均优于现有的流式基线方法。

0 人收藏 0 人点赞
#long-horizon

Crayotter:通过组相对偏好反向传播学习长视界视频编辑智能体

arXiv cs.CL · 2026-08-05 缓存

Crayotter 引入了组相对偏好反向传播(GRPB),一种训练长视界视频编辑智能体的方法,利用任务内偏好排序而非全局标量奖励。由此产生的 9B 模型在 AgenticVBench 上超越了多个专有系统。

0 人收藏 0 人点赞
#long-horizon

长时程终端任务的递归合成

Hugging Face Daily Papers · 2026-08-05 缓存

本文介绍了递归合成终端任务(RST),一种递归验证的合成框架,用于大规模生成长时程终端智能体训练数据,共生成37,484个任务,并在终端基准上提升了Qwen3.5模型的表现。

0 人收藏 0 人点赞
#long-horizon

迈向技能原生的大语言模型:用于长程推理基准测试与训练的技能熵

Hugging Face Daily Papers · 2026-08-05 缓存

本文介绍了技能熵(Skill Entropy),一种衡量跨技能切换难度的指标,以及 Skill^2-Bench,一个覆盖 558 项技能的长程推理任务基准。作者还提出了 Skill-EntropyRL,一个训练框架,将 Qwen3 模型上的推理性能从 34.4% 提升到 68.4%,并从 14.6% 提升到 40.1%。

0 人收藏 0 人点赞
#long-horizon

WorldCycle:面向长视界视频世界模型的自验证强化学习

Hugging Face Daily Papers · 2026-08-05 缓存

WorldCycle提出了一种面向长视界视频世界模型的自验证强化学习方法,利用可逆动作循环作为免费监督,将状态回归漂移降低最多44%,并将复合动作准确率提升近4倍。它还引入了CycleBench,以评估作为模拟器的世界模型。

0 人收藏 0 人点赞
#long-horizon

OneDayAgent:迈向自主智能体的长时程执行框架

Hugging Face Daily Papers · 2026-08-04 缓存

OneDayAgent 是一个面向自主智能体的长时程执行框架,它将开放式任务分解为有界子任务,在上下文压力下管理执行记忆,并验证/修复最终输出。它在 AgentIF-OneDay 上使用 GLM-5.2 达到了当前最优水平,并能泛化到五个后端 LLM。

0 人收藏 0 人点赞
#long-horizon

MirrorCode(8分钟阅读)

TLDR AI · 2026-08-04 缓存

Epoch AI 和 METR 推出了 MirrorCode,这是一个基准测试,用于测试 AI 模型在长时间跨度内端到端重新实现整个程序的能力。早期结果显示,Claude Opus 4.7 在 14 小时内解决了一个生物信息学工具包,花费 251 美元,但记忆化方面的注意事项仍然存在。

0 人收藏 0 人点赞
#long-horizon

HERO:面向长时程自回归神经算子的历史增强展开训练

arXiv cs.LG · 2026-08-03 缓存

本文提出HERO(历史增强展开训练),一种通过模型自身优化历史的相对监督来增强自回归神经算子的标准轨迹监督的方法,提高了PDE基准上的长时程精度和稳定性。

0 人收藏 0 人点赞
#long-horizon

最好的朋友,并非永远:评估AI伴侣中的长期角色崩塌与行为漂移

arXiv cs.AI · 2026-08-03 缓存

本文介绍了Anchor,一个用于评估AI伴侣中长期角色稳定性与轨迹记忆的合成审计框架,发现当前模型在长时间交互中无法可靠地保持身份与记忆。

0 人收藏 0 人点赞
#long-horizon

ThinkReset:面向有限上下文长程推理的可学习中间接口构建

arXiv cs.AI · 2026-08-03 缓存

本文提出ThinkReset方法,通过构建可复用的中间接口来替代被丢弃的推理历史,从而在受限上下文窗口下实现更好的长程推理。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈