标签
Matryoshka Agent 是一个层次化代理框架,它将长期机器学习工程任务分解为高级编排器和低级子代理,实现高效探索和迭代优化。它在复杂的 MLE 任务上显著提升性能,使 4B 模型匹配 o4-mini 的编排能力,并在 30B 编码器模型上带来高达 36.7% 的相对收益。
StateAct 提出了一种代码优先的多代理系统,用于长时域计算机使用代理,该系统直接操作程序状态而非截图,在 OSWorld2.0 上实现了更高的成功率和更低的成本。
本文引入了一个受控的多轮环境,以系统研究基础模型智能体在预训练、后训练(通过GRPO与在线策略蒸馏)以及集成(通过多教师在线策略蒸馏)阶段的长程规划能力。
JarvisHub是一个开放框架,专为画布原生多模态创意代理设计,它将可编辑画布作为用户工作区,实现可检查和可编辑状态下的长周期创意自动化。
详细对比了新开源权重混合专家模型 Laguna-S-2.1 与 Qwen 3.6-35B-A3B,突出了Laguna更大的活跃参数数量和长期关注焦点使其在扩展任务中表现更优,尽管速度较慢。
ABot-World-0是一个实时的、长时域交互式视频世界模型,可在单台式机GPU上运行,通过动作条件控制实现无限世界展开。
小米MiMo团队开源了编程Agent MiMo Code,基于OpenCode,针对长程自动化任务,围绕计算、记忆、进化三个主题设计了多种机制,如并行采样选优、独立完成度验证、动态工作流和循环记忆系统。
介绍Hindsight Policy Optimization (HPO),一种新颖的策略梯度方法,它利用意图空间和Wasserstein距离来减少长周期语言智能体训练中的方差,显示出比GRPO和PPO更好的稳定性。
MSCE是一种免训练框架,将LLM智能体的经验组织为三个记忆层次,并将其转化为带有证据链接的可复用技能,优于现有的记忆增强和技能增强基线。
AlayaWorld是一个150亿参数的交互式视频世界模型,可生成24帧/秒的540p和720p视频,采用自回归潜变量块生成、受限视觉上下文以及蒸馏技术来减少推理步骤。它在长视界生成基准iWorld-Bench上达到了最先进的性能。
ToolVerse是一个框架,可从422个真实世界MCP环境(包含4438个工具)自动构建大规模可执行智能体训练环境,并提出了一种基于动态解锁采样算法的任务设计策略以生成长程任务,以及一种用于智能体强化学习中信用分配的轮次感知相对优势算法。
本文介绍了TRACE,一种用于长周期智能体强化学习的密集信用分配方法,该方法在不使用额外评论模型的情况下,显著提升了Qwen3小型MoE模型在智能体基准测试上的表现。
Oracle推出了Agent Memory,一种面向长周期AI智能体的数据库原生记忆基座,相比于扁平历史基线,在准确率高达93.8%的同时,token用量减少至原来的1/10.7(即减少约10.7倍)。
长时域终端基准 (LHTB) 是一个包含46项任务的基准,用于评估LLM智能体在数百步的持续终端工作中的表现。结果显示,即使是最好的模型也只能解决约28%的任务。
本文介绍了ABot-AgentOS,一种具有终身多模态记忆的通用机器人智能体操作系统,并提出了用于评估长周期具身任务的EmbodiedWorldBench。实验表明,该系统在任务成功率和记忆基准测试中取得了显著改进,表明专用的智能体操作系统层能够增强执行能力和持久记忆。
Meta研究人员提出了一种主动记忆代理,它与未经修改的行动代理并行运行,以呈现相关的过去决策,并防止在长周期任务中发生遗忘。他们的方法在Terminal-Bench 2.0和tau-squared-Bench上分别将pass@1提高了8.3和6.8个百分点。
提出了高效长时域优化(ELO)学习,一种元训练算法,它将计算重新分配给更长的时域,并使用解耦的渐进式专家监督,提高了学习优化器在长展开任务和分布外泛化上的性能。ELO-Celo2在语言建模任务上持续优于AdamW,并与Muon性能相当。
介绍了 Long-Horizon-Terminal-Bench,这是一个包含46个长时程终端任务的基准,采用密集奖励评分,评估AI智能体在规划、长上下文和调试方面的能力。即使是最强模型也仅达到15.2%的pass@1,显示仍有很大的改进空间。
本文介绍了一种前瞻性记忆代理,它与动作代理并行运行,以防止长周期任务中的行为状态衰减,在Terminal-Bench2.0和τ^2-Bench上取得了显著提升。作者还使用SFT和GRPO训练了Qwen3.5-27B,作为迈向开放权重记忆策略的初步步骤。
LongE2V利用预训练的视频扩散先验,并引入自回归展开、自适应上下文切换、重编码对齐和事件体素密度增强,从稀疏事件流中实现高质量的视频重建、预测和帧插值,优于现有最先进方法。