OmniAssistBench: 针对全能大语言模型的助理式交互基准测试
摘要
OmniAssistBench 是一个用于评估作为实时视频助理的全能大语言模型的基准测试,揭示当前模型在视觉提示、上下文保持和及时响应方面存在困难。
查看缓存全文
缓存时间: 2026/08/24 04:39
论文页面 - OmniAssistBench:面向全模态大语言模型的助手式交互基准测试
来源:https://huggingface.co/papers/2608.21360
摘要
OmniAssistBench通过逆向工程多轮交互视频来评估实时交互式视频助手,揭示了当前全模态模型在视觉提示、上下文保持和及时响应方面存在的困难。
近期,全模态大语言模型(https://huggingface.co/papers?q=omni-modal%20large%20language%20models)(Omni-LLMs)作为实时视频助手展现出巨大潜力,能够持续感知环境并引导用户达成特定目标。与传统被动式视频理解不同,交互式助手需要主动整合视觉状态、用户目标和先验知识以提供有效帮助。然而评估此类模型颇具挑战——模型的不可预测响应会动态改变用户的后续行为,这是静态离线数据集无法模拟的。为此,我们引入了OmniAssistBench(https://huggingface.co/papers?q=OmniAssistBench)。为解决同一用户目标可通过多种路径实现导致的交互路径发散问题,我们向模型提供了源自原始视频的预定义先验信息,要求它们引导用户沿着完全相同的路径操作。由于真实交互视频资源稀缺,我们通过逆向工程现有网络视频构建数据集。我们推导出逻辑用户目标,并将视频分割为多轮片段以模拟连续交互。这套严谨的流程耗费超过1000专家工时才完成数据集构建。实验结果显示,专有模型Gemini-3-Pro在满分100分中获得66.4分,而开源模型Qwen3-Omni-Instruct获得51.2分。尽管当前模型普遍能理解用户输入,但经常给出错误或不完整的回答。具体而言,它们在处理视觉提示(https://huggingface.co/papers?q=visual%20prompts)(如手势)时存在困难,在多轮交互(https://huggingface.co/papers?q=multi-turn%20interactions)中未能保持历史上下文(https://huggingface.co/papers?q=historical%20context),且无法延迟响应直到目标事件发生。结果表明,在模型成为可靠助手之前仍有巨大改进空间。
查看arXiv页面(https://arxiv.org/abs/2608.21360)查看PDF(https://arxiv.org/pdf/2608.21360)项目页面(https://xianyunsun.github.io/OmniAssistBench/)GitHub5(https://github.com/XianyunSun/OmniAssistBench)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.21360)
在您的代理中获取此论文:
hf papers read 2608\.21360
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.21360即可从本页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.21360即可从本页面链接。
引用此论文的空间0
无空间链接此论文
在空间README.md中引用arxiv.org/abs/2608.21360即可从本页面链接。
包含此论文的合集0
无合集包含此论文
将此论文添加到合集(https://huggingface.co/new-collection)即可从本页面链接。
相似文章
OmniInteract:面向实时全模态助手的真实世界流式交互基准测试
OmniInteract 提出了一个面向实时全模态大语言模型的流式基准测试,评估在线音视频处理能力,要求具备时间定位和交互式响应。实验表明,当前模型表现不佳,最佳整体 IA-QTF1 分数仅为 0.368。
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。
Omni-DuplexEval: 评估实时双工全模态交互
本文介绍了Omni-DuplexEval,这是一个用于多模态大语言模型中实时双工交互的基准测试和自动评估框架,旨在评估流式场景下的连续响应生成和主动事件检测。
OmniPro:面向全主动流式视频理解的综合基准
OmniPro 是首个用于评估全模态大语言模型中主动流式视频理解的基准,包含 2,700 个样本,覆盖多种任务和双模式评估协议。
TOBench:面向真实世界工具使用智能体的任务导向全模态基准
TOBench是一个新的基准测试,用于评估AI智能体在真实世界、任务导向的工具使用中的表现,涉及多模态输入和闭环验证。实验表明,像Qwen 3.5 Plus这样的顶级模型仅达到41%的成功率,远低于94%的人类基准,凸显了显著的差距。