标签
本文提出 VHop,一个面向多步视觉检索的数据生成框架与基准,以及 VHop-Router——一个在视觉隐空间中运行、经过端到端训练的自回归多步检索器,将检索成功率从不足 5% 提升至 76.3%,使智能体搜索成功率提高 52.7%,同时大幅减少 token 消耗与 API 载荷。
WorldAuditBench 是一个包含213个异常审计任务的基准,涵盖13个基于 Unreal Engine 5 / Three.js 构建的交互式3D环境,用于评估多模态智能体能否将动作与视觉推理有效耦合。前沿模型的成功率仅为6.6%–42.3%,远低于人类的83.4%,凸显出当前在证据收集与解读方面的局限性。
该论文提出了VideoLoop,一个具有循环工作记忆的多模态智能体,以解决长视频理解中的语义抖动问题,并在VideoMME等基准测试中展示了性能提升。
论文提出了 NavHarness——一种免训练的具身导航框架(harness),将记忆处理融入导航循环,使智能体能够在不同会话之间携带经验,实现终身导航。在 GOAT-Bench 上,相比仅依赖上下文的独立会话,该方法将成功率最高提升 22.6 个百分点,并借助 GPT-6/Astra 达到当前最优结果。
本文介绍CoCA,一种用于长期多模态智能体动态能力分配的on-policy学习框架,通过条件比较和强化学习来解决计算开销和阶段依赖需求。
Qwen3.8-Omni-Flash是一款原生多模态智能体模型,旨在提升真实世界生产力。它通过MoE架构和扩展上下文窗口增强了多模态理解与推理能力,并发布了多模态应用的开源框架。
UI-Venus-2 是一个开源的多模态图形用户界面代理,旨在通过移动、网络和桌面环境实现数字化自动化。它采用统一的推理-行动循环与强大的验证机制,以支持可靠的实际应用。
本文介绍了一个关于多模态代理框架中技能发现与路由的案例研究,表明在提示中部分暴露技能可能会产生词汇竞争,从而阻碍正确选择,将小规模的上下文检索与大规模方法联系起来。
本综述分析了多模态性对智能体框架的影响,考察了感知、推理和规划等核心模块,并回顾了在机器人、图形用户界面导航及其他领域的应用。
一项新的基准测试,用于评估多模态代理从自然语言构建3D开放世界的能力,显示GPT-5.5和Qwen3.8-Max得分低于60%,而一个开源30B模型通过强化学习实现了最佳性能。
本文提出了VibeWorlding,一个用于基准测试和训练多模态智能体的框架,使其能够从用户查询构建3D开放世界,并展示了强化学习如何提升开源模型以与闭源前沿模型竞争。
本文介绍了 OpenVisTool,一个用于合成指导性视觉工具使用轨迹的开放框架,以及相应的数据集(OpenVisTool-42K)和基准。研究表明,在基于因果关系的监督下进行微调,能在多种模型骨干上提升视觉工具使用性能。
本文认为简单地扩展多模态环境并不总能改善智能体训练,并提出了能力感知环境选择(AES)和分层难度课程(HDC),以在多样性和难度维度上更好地构建环境分布。
DeepVoyager-VL 提出了一种长时程多模态深度搜索框架,将视觉证据融入中间推理过程,利用多模态事件图进行数据合成和微调,而无需强化学习,在十个基准测试上取得了强劲性能。
CaM-Wolf是首个面向狼人杀等社交推理游戏的多模态AI智能体,集成了视频感知与生成,并通过强化学习训练的因果感知推理器来处理隐藏角色和社交推理任务。实验和用户研究显示,它在游戏表现和人机交互质量上均有显著提升。
本文介绍了GPTNT,这是一个基于《Keep Talking and Nobody Explodes》构建的基准测试,要求两个多模态代理在时间压力和信息不对称条件下实时协作,揭示了当前最先进系统的关键弱点。
介绍DMV-Bench,一个用于评估多模态智能体视觉记忆的交互式基准测试,该测试利用产品图像中的偶然视觉线索,并提出了DualMem,一种双编码记忆架构,在各种链长度上优于纯文本和其他多模态基线。
本文介绍了AgentViSS基准,用于评估多模态社交模拟中的视觉社交智能,包含240个场景及对齐的视觉文本证据。评估七个近期MLLM发现局部角色扮演与基于视觉的交互管理之间存在差距。
SpatialWorld是一个统一的基准测试,用于评估多模态智能体在各种真实世界任务中的交互式空间推理能力。结果表明,即使是最强大的模型,其任务成功率也很低。
介绍了TaskMem,一种基于强化学习的多模态代理动态记忆框架,在流式视频基准测试上实现了6.3%、7.0%和5.3%的准确率提升。