标签
本文介绍SCOPE,一种用于计算机使用智能体的联合训练方法,它利用合成数据集,提升了任务完成度和安全性,并在基准测试OSWorld和OS-BLIND上取得了优异性能。
一项系统性的基准测试研究,对多模态大语言模型的免训练不确定性量化策略进行评测,将方法分为基于令牌级、语言化和语义的方法,并发现最佳策略取决于响应长度。
PolyBridgeBench是一种新的可执行基准测试,用于评估多模态大型语言模型在基于物理的桥梁设计任务中的表现,揭示了结构合成与修复中确定性有效性与动态成功之间的差距。
本文提出AREA,一种无需训练的推理时方法,自适应分配多模态大语言模型中的证据高亮,提升在基于知识的视觉问答和标准多模态基准测试上的性能。
OmniHallu引入了一个统一的幻觉检测框架,适用于多模态大语言模型,涵盖图像、视频和音频模态的理解与生成任务,并包括一个基准测试和多智能体架构。
ReactHuman 是一个物理基础的基准,用于评估多模态大语言模型在模拟人形机器人面对家庭危险时的类人反应性决策能力,揭示了持续的安全故障,并提供了一个可扩展的诊断工具。
本文提出了HEAL,一种通过因果干预和反事实分析来分析和校准协同头中信息分布的方法,以减轻多模态大型语言模型中的幻觉。
本文介绍了TA-SPA,一个针对多模态大型语言模型的黑盒越狱攻击框架,该框架利用基于文本的语义扰动,实现针对安全对齐的有效且可转移的攻击。
Video-IFBench 介绍了一个综合基准,用于评估多模态大语言模型在视频理解任务中遵循多样化指令的能力,涵盖多种约束条件和任务类型。
本文提出了一种面向GUI代理的长度感知对比学习(LACL-GUI),这是一种对比强化学习框架,通过纳入轨迹级质量信号来解决奖励-梯度错位问题,从而提升代理性能。
OraRL 通过将标注整合为 oracle rollout,改进了视频多模态语言模型的强化学习后训练,实现了更高的样本效率和性能,无需思维链生成。
该推文指出,能够处理气味的多模态大语言模型尚未存在,凸显了当前人工智能技术的局限性。
MobileForge 是一个面向项目级多屏移动应用生成的基准测试,用于评估多模态大语言模型在构建成功、跨页导航、视觉保真度、可维护性和效率方面的表现。对六个前沿多模态大语言模型的实验表明,当前模型能够编译并到达目标页面,但在交互式导航和视觉质量方面仍存在困难。
本文介绍了TokenSwap,一种将纯文本基准测试转换为图像交错对应物的方法,以及TokenSwap-Bench,用于衡量42个多模态大语言模型的模态差距。研究发现推理模型的差距较小,并表明基于TokenSwap的训练可以缩小这一差距。
本文介绍了Symphony-Bias,一个用于评估大语言模型在文本、视觉和音频模态下乐器与性别关联偏见的多模态数据集。研究发现,92%的乐器层面结果与先前社会科学研究一致,其中文本模态的性别偏见最强,音频最弱。
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。
关于使用大语言模型进行多模态幽默理解的全面综述,涵盖方法、数据集、评估协议以及在解读迷因、卡通和漫画中幽默的挑战。
本文介绍了ActiveVision,一个用于评估多模态大语言模型主动观察能力的基准测试。前沿模型如GPT-5.5和Claude Fable 5表现不佳,分别仅解决了10.6%和3.5%的任务,而人类达到了96.1%,凸显了迭代视觉感知的缺失。
本文评估了多模态大语言模型(MLLMs)在图像局部概念命名中的零样本能力,提出了一种可复现的评估协议,在无训练的情况下实现了62-88%的对象级准确率。
NormAct是一个基准,用于评估具身规划代理在隐藏社会规范遵守方面的表现,结果显示最先进的多模态大语言模型(MLLMs)在目标达成率为67.3%时,规范遵守率仅为26.4%,并提出了NormPerceptor,将任务成功率从24.2%提升至46.7%。