multimodal-llms

标签

Cards List
#multimodal-llms

超越任务完成:训练有能力且安全的计算机使用智能体

arXiv cs.LG ↗ · 3天前 缓存

本文介绍SCOPE,一种用于计算机使用智能体的联合训练方法,它利用合成数据集,提升了任务完成度和安全性,并在基准测试OSWorld和OS-BLIND上取得了优异性能。

0 人收藏 0 人点赞
#multimodal-llms

剖析多模态大语言模型中的免训练不确定性估计

arXiv cs.CL ↗ · 3天前 缓存

一项系统性的基准测试研究,对多模态大语言模型的免训练不确定性量化策略进行评测,将方法分为基于令牌级、语言化和语义的方法,并发现最佳策略取决于响应长度。

0 人收藏 0 人点赞
#multimodal-llms

PolyBridgeBench:用于基于物理的桥梁设计的多模态大型语言模型基准测试

arXiv cs.AI ↗ · 4天前 缓存

PolyBridgeBench是一种新的可执行基准测试,用于评估多模态大型语言模型在基于物理的桥梁设计任务中的表现,揭示了结构合成与修复中确定性有效性与动态成功之间的差距。

0 人收藏 0 人点赞
#multimodal-llms

层级、汇聚与缩放:多模态大语言模型的自适应证据选择

arXiv cs.AI ↗ · 2026-09-16 缓存

本文提出AREA,一种无需训练的推理时方法,自适应分配多模态大语言模型中的证据高亮,提升在基于知识的视觉问答和标准多模态基准测试上的性能。

0 人收藏 0 人点赞
#multimodal-llms

OmniHallu:用于多模态大语言模型中跨模态理解与生成的统一幻觉检测

arXiv cs.CL ↗ · 2026-09-11 缓存

OmniHallu引入了一个统一的幻觉检测框架,适用于多模态大语言模型,涵盖图像、视频和音频模态的理解与生成任务,并包括一个基准测试和多智能体架构。

0 人收藏 0 人点赞
#multimodal-llms

ReactHuman:一个面向具身多模态大语言模型的物理基础类人反应性决策基准

Hugging Face Daily Papers ↗ · 2026-09-09 缓存

ReactHuman 是一个物理基础的基准,用于评估多模态大语言模型在模拟人形机器人面对家庭危险时的类人反应性决策能力,揭示了持续的安全故障,并提供了一个可扩展的诊断工具。

0 人收藏 0 人点赞
#multimodal-llms

MLLMs 在信息分布偏离协同头时产生幻觉

Hugging Face Daily Papers ↗ · 2026-09-05 缓存

本文提出了HEAL,一种通过因果干预和反事实分析来分析和校准协同头中信息分布的方法,以减轻多模态大型语言模型中的幻觉。

0 人收藏 0 人点赞
#multimodal-llms

@LeeLeepenkman: 多模态大型语言模型的文本锚定语义扰动可转移越狱攻击 https://pap…

X AI KOLs Timeline ↗ · 2026-08-26 缓存

本文介绍了TA-SPA,一个针对多模态大型语言模型的黑盒越狱攻击框架,该框架利用基于文本的语义扰动,实现针对安全对齐的有效且可转移的攻击。

0 人收藏 0 人点赞
#multimodal-llms

Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力

Hugging Face Daily Papers ↗ · 2026-08-26 缓存

Video-IFBench 介绍了一个综合基准,用于评估多模态大语言模型在视频理解任务中遵循多样化指令的能力,涵盖多种约束条件和任务类型。

0 人收藏 0 人点赞
#multimodal-llms

超越成功与失败:面向GUI代理的长度感知对比学习

arXiv cs.AI ↗ · 2026-08-25 缓存

本文提出了一种面向GUI代理的长度感知对比学习(LACL-GUI),这是一种对比强化学习框架,通过纳入轨迹级质量信号来解决奖励-梯度错位问题,从而提升代理性能。

0 人收藏 0 人点赞
#multimodal-llms

注解作为 Rollout:视频 MLLMs 的高效可扩展强化学习

Hugging Face Daily Papers ↗ · 2026-08-20 缓存

OraRL 通过将标注整合为 oracle rollout,改进了视频多模态语言模型的强化学习后训练,实现了更高的样本效率和性能,无需思维链生成。

0 人收藏 0 人点赞
#multimodal-llms

@BenjaminDEKR: 我们尚未有处理气味的多模态LLMs

X AI KOLs Timeline ↗ · 2026-08-16

该推文指出,能够处理气味的多模态大语言模型尚未存在,凸显了当前人工智能技术的局限性。

0 人收藏 0 人点赞
#multimodal-llms

视觉正确、运行正确:多屏移动应用生成的项目级基准

arXiv cs.AI ↗ · 2026-08-03 缓存

MobileForge 是一个面向项目级多屏移动应用生成的基准测试,用于评估多模态大语言模型在构建成功、跨页导航、视觉保真度、可维护性和效率方面的表现。对六个前沿多模态大语言模型的实验表明,当前模型能够编译并到达目标页面,但在交互式导航和视觉质量方面仍存在困难。

0 人收藏 0 人点赞
#multimodal-llms

TokenSwap:基准测试并缩小多模态大语言模型中的模态差距

arXiv cs.CL ↗ · 2026-08-03 缓存

本文介绍了TokenSwap,一种将纯文本基准测试转换为图像交错对应物的方法,以及TokenSwap-Bench,用于衡量42个多模态大语言模型的模态差距。研究发现推理模型的差距较小,并表明基于TokenSwap的训练可以缩小这一差距。

0 人收藏 0 人点赞
#multimodal-llms

偏见交响曲:探索多模态大语言模型中乐器与性别关联

arXiv cs.CL ↗ · 2026-07-30 缓存

本文介绍了Symphony-Bias,一个用于评估大语言模型在文本、视觉和音频模态下乐器与性别关联偏见的多模态数据集。研究发现,92%的乐器层面结果与先前社会科学研究一致,其中文本模态的性别偏见最强,音频最弱。

0 人收藏 0 人点赞
#multimodal-llms

看见还是知道?多模态大语言模型中的视觉上下文敏感性

Hugging Face Daily Papers ↗ · 2026-07-28 缓存

本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。

0 人收藏 0 人点赞
#multimodal-llms

多模态大语言模型的计算幽默:方法、数据集、评估与挑战

arXiv cs.CL ↗ · 2026-07-22 缓存

关于使用大语言模型进行多模态幽默理解的全面综述,涵盖方法、数据集、评估协议以及在解读迷因、卡通和漫画中幽默的挑战。

0 人收藏 0 人点赞
#multimodal-llms

主动观察者的测试

arXiv cs.CL ↗ · 2026-07-20 缓存

本文介绍了ActiveVision,一个用于评估多模态大语言模型主动观察能力的基准测试。前沿模型如GPT-5.5和Claude Fable 5表现不佳,分别仅解决了10.6%和3.5%的任务,而人类达到了96.1%,凸显了迭代视觉感知的缺失。

0 人收藏 0 人点赞
#multimodal-llms

低成本概念级局部解释:无训练方法能走多远?

arXiv cs.AI ↗ · 2026-06-30 缓存

本文评估了多模态大语言模型(MLLMs)在图像局部概念命名中的零样本能力,提出了一种可复现的评估协议,在无训练的情况下实现了62-88%的对象级准确率。

0 人收藏 0 人点赞
#multimodal-llms

NormAct:具身规划中隐藏社会规范遵守的基准

arXiv cs.AI ↗ · 2026-06-29 缓存

NormAct是一个基准,用于评估具身规划代理在隐藏社会规范遵守方面的表现,结果显示最先进的多模态大语言模型(MLLMs)在目标达成率为67.3%时,规范遵守率仅为26.4%,并提出了NormPerceptor,将任务成功率从24.2%提升至46.7%。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈