long-horizon-tasks

标签

Cards List
#long-horizon-tasks

@rohanpaul_ai: “长期任务仍然是个笑话。它们根本行不通,我不在乎任何人说什么。别给我看那些愚蠢的评估。

X AI KOLs Timeline ↗ · 2026-08-28 缓存

Chamath 批评 AI 领域中的长期任务效率低下,预测其将经历炒作周期并陷入幻灭低谷,同时建议使用符号空间来引导嵌入空间,以提升 AI 性能。

0 人收藏 0 人点赞
#long-horizon-tasks

LoopArena:针对循环工程的运行时控制器模型基准测试

Hugging Face Daily Papers ↗ · 2026-08-28 缓存

LoopArena推出一项基准测试,评估模型在编码代理任务中充当循环工程运行时控制器的表现,结果显示严格成功率较低,但成本显著降低。

0 人收藏 0 人点赞
#long-horizon-tasks

@FactoryAI: 我们构建了世界上最先进的程序逆向工程系统。它是模型独立的,并展示了改进的…

X AI KOLs Following ↗ · 2026-08-27 缓存

FactoryAI 开发了一个模型独立的程序逆向工程系统,该系统通过提供独立的完成定义,改善了所有测试的前沿模型在长时程软件任务上的性能。

0 人收藏 0 人点赞
#long-horizon-tasks

介绍 Vetta:用于长期代理任务的最高效工具。相同模型,相同任务。仅更换工具。

X AI KOLs Following ↗ · 2026-08-24 缓存

Vetta 被介绍为一种成本效益高的长期代理任务工具,将每任务成本降低至 $0.298,而 claude-code 为 $0.872,hermes 为 $1.095。

0 人收藏 0 人点赞
#long-horizon-tasks

Agent-G^2:基于高斯指导的代理强化学习

Hugging Face Daily Papers ↗ · 2026-08-24 缓存

Agent-G^2 引入了一个高斯指导框架,用于强化学习中的提示深度,提升了长期代理任务的性能,无需额外的探测回合,并在 ALFWorld 和 WebShop 基准测试中取得优异结果。

0 人收藏 0 人点赞
#long-horizon-tasks

Nvidia刚刚表明,环绕AI模型的系统,而非模型本身,才是真正的英雄

TechCrunch AI ↗ · 2026-08-21 缓存

Nvidia的研究表明,围绕AI模型设计精良的系统,而非模型本身,能显著提升长期任务的表现,其中Claude Opus 5在ARC-AGI-3基准测试中获得了满分。

0 人收藏 0 人点赞
#long-horizon-tasks

将近22天,单一目标,180万行代码库:我们是否错误地衡量了代理的自主性?

Reddit r/AI_Agents ↗ · 2026-08-20

AutoNodo 在一个180万行的代码库上实现了对单一技术目标的近22天连续自主执行,质疑了当前编程代理的自主性指标。

0 人收藏 0 人点赞
#long-horizon-tasks

@svpino: 开放模型的进步让大AI实验室夜不能寐,我正为此而来!我们推出了一款全新的开放权重多模…

X AI KOLs Following ↗ · 2026-08-19 缓存

文章介绍了dots3-note Preview模型,这是一个开放权重多模态AI模型,针对长期任务进行了优化,并采用了TEMPO强化学习技术,该技术支持自我批评和适应。

0 人收藏 0 人点赞
#long-horizon-tasks

TL;DR:为什么 dsh/cordis 很重要:长时任务和框架元调优

Reddit r/singularity ↗ · 2026-08-15

Cordis 是一个支持长时任务的框架,它通过可逆的、跟踪的上下文系统实现崩溃恢复和动态插件添加,确保高效且损失最小的状态管理。

0 人收藏 0 人点赞
#long-horizon-tasks

超越最终分数:长期AI研发智能体的系统性评估

Hugging Face Daily Papers ↗ · 2026-08-13 缓存

本文系统评估了七个前沿AI智能体在长期任务上的表现,发现它们更像是工程优化器而非自主研究者,并提出了改进训练和经验管理的建议。

0 人收藏 0 人点赞
#long-horizon-tasks

@Xudong07452910: 一个 Agent 做了 20 步任务,最后只收到一个「成功 / 失败」。 训练时怎么知道,真正救了这次任务的到底是哪一步? 清华、浙大和美团团队这篇 AgentOPSD,研究的就是长时 Agent 的信用分配问题。 GRPO 通常把最终奖…

X AI KOLs Timeline ↗ · 2026-08-10 缓存

清华、浙大和美团团队提出AgentOPSD,一种递归自蒸馏的信用分配方法,将稀疏的最终奖励转化为逐步信用信号,提升长时Agent强化学习性能。在ALFWorld等任务上显著优于GRPO基线。

0 人收藏 0 人点赞
#long-horizon-tasks

可验证记忆:利用局部和全局验证器为大型语言模型智能体学习统一内存管理

arXiv cs.AI ↗ · 2026-08-05 缓存

VerMem是一个用于LLM智能体的统一内存管理框架,利用局部和全局验证器结合强化学习,共同控制长期记忆和短期记忆。它在五个基准测试上优于强基线,并改善了效率-性能权衡。

0 人收藏 0 人点赞
#long-horizon-tasks

OmegaUse-OfficeVal:基于经济基准的长期办公套件任务LLM代理评估

Hugging Face Daily Papers ↗ · 2026-07-29 缓存

OmegaUse-OfficeVal是一个基准测试,用于评估LLM代理在长期办公套件任务中的表现,并结合经济基准,比较人力成本与LLM推理成本。该基准包含100个任务,每个任务需要约2.3小时的人力劳动。研究发现,前沿LLM虽然更便宜、更快速,但质量仍低于人类水平。

0 人收藏 0 人点赞
#long-horizon-tasks

面向长周期代理任务的进度条件组策略优化

arXiv cs.LG ↗ · 2026-07-28 缓存

提出进度条件组策略优化(ProGPO),通过在组内所有样本均失败时使用首次访问的观察覆盖率,克服长周期代理任务中的信用分配问题,在ALFWorld和WebShop上提升了性能。

0 人收藏 0 人点赞
#long-horizon-tasks

RoboTTT: Context Scaling for Robot Policies

Hugging Face Daily Papers ↗ · 2026-07-16 缓存

RoboTTT将视觉运动上下文扩展到机器人策略的8K时间步长,实现了从人类视频演示中一次模仿、即时策略改进以及对扰动的鲁棒性。它比基线提高了87%,并完成了一个五分钟、十阶段的组装任务,而基线无法完成。

0 人收藏 0 人点赞
#long-horizon-tasks

SelfMem: 面向AI智能体的自优化记忆框架

arXiv cs.CL ↗ · 2026-07-07 缓存

SelfMem提出了一种面向AI智能体的自优化记忆框架,使其能够通过记忆工具和反馈信号探索、评估和优化自身的记忆策略,在BEAM基准测试上,于大型对话规模下相较于基线方法取得了显著改进。

0 人收藏 0 人点赞
#long-horizon-tasks

RoboTALES:通过任务对齐的模拟未来学习推理引导的机器人策略

Hugging Face Daily Papers ↗ · 2026-07-07 缓存

RoboTALES引入了一个两阶段框架,结合基于LLM的规划和基于VLM的批评,以改进任务对齐的视频生成和机器人策略训练,在长时域操作任务上显著优于现有方法。

0 人收藏 0 人点赞
#long-horizon-tasks

@omarsar0: // AutoMem // 我非常喜欢这个元记忆的概念。(标记一下) 这项来自斯坦福的新研究将智能体的记忆…

X AI KOLs Timeline ↗ · 2026-07-02 缓存

这篇斯坦福研究论文介绍了AutoMem,这是一个将智能体记忆管理视为可训练技能的框架。通过分别优化记忆结构和熟练度,AutoMem在长周期任务上将基础智能体性能提升了2到4倍,使得一个32B开源权重模型能够与Claude Opus 4.5和Gemini 3.1 Pro Thinking等前沿系统竞争。

0 人收藏 0 人点赞
#long-horizon-tasks

AutoMem: 作为认知技能的记忆自动化学习

arXiv cs.AI ↗ · 2026-07-02 缓存

AutoMem 引入了一个框架,将记忆管理作为 LLM 的可训练技能进行自动化学习,通过优化记忆结构和熟练度,将长期任务的性能提升 2-4 倍。

0 人收藏 0 人点赞
#long-horizon-tasks

OSWorld2.0:长周期真实世界任务中计算机使用代理的基准评测

Hugging Face Daily Papers ↗ · 2026-06-28 缓存

OSWorld 2.0 是一个新的基准测试,用于评估计算机使用代理在 108 个长周期真实工作流程上的表现。当前像 Claude Opus 4.8 和 GPT-5.5 这样的代理完成率较低,凸显了它们在处理复杂多步骤任务时的显著局限性。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈