OmniAssistBench: 针对全能大语言模型的助理式交互基准测试

Hugging Face Daily Papers 论文

摘要

OmniAssistBench 是一个用于评估作为实时视频助理的全能大语言模型的基准测试,揭示当前模型在视觉提示、上下文保持和及时响应方面存在困难。

近期,全能大语言模型(Omni-LLMs)作为实时视频助理展现出巨大潜力,能够持续感知环境并引导用户实现特定目标。与传统的被动视频理解不同,交互式助理应主动结合视觉状态、用户目标和先验知识以提供有效帮助。评估这一点相当具有挑战性,因为模型不可预测的响应会动态改变用户的后续操作,而静态离线数据集无法适应这种情况。为解决这一瓶颈,我们推出了 OmniAssistBench。为了解决交互路径分歧的问题,即同一用户目标可以通过多种方法实现,我们提供基于源视频的预定义先验知识,要求模型引导用户沿着完全相同的路径操作。由于真实的交互视频稀缺,我们通过逆向工程现有互联网视频来构建数据集。我们推断合理的用户目标,并将视频分割成多轮片段以模拟持续交互。这一严格流程需要超过 1000 专家工时来构建数据集。结果显示,专有的 Gemini-3-Pro 在满分 100 分中达到 66.4 分,而开源的 Qwen3-Omni-Instruct 达到 51.2 分。尽管当前模型通常能理解用户输入,但它们经常提供错误或不完整的答案。具体而言,它们在视觉提示(如手势)方面存在困难,在多轮交互中未能保持历史上下文,并且未能延迟响应直到目标事件发生。结果表明,在模型成为可靠助理之前,仍有很大的改进空间。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:39

论文页面 - OmniAssistBench:面向全模态大语言模型的助手式交互基准测试

来源:https://huggingface.co/papers/2608.21360

摘要

OmniAssistBench通过逆向工程多轮交互视频来评估实时交互式视频助手,揭示了当前全模态模型在视觉提示、上下文保持和及时响应方面存在的困难。

近期,全模态大语言模型(https://huggingface.co/papers?q=omni-modal%20large%20language%20models)(Omni-LLMs)作为实时视频助手展现出巨大潜力,能够持续感知环境并引导用户达成特定目标。与传统被动式视频理解不同,交互式助手需要主动整合视觉状态、用户目标和先验知识以提供有效帮助。然而评估此类模型颇具挑战——模型的不可预测响应会动态改变用户的后续行为,这是静态离线数据集无法模拟的。为此,我们引入了OmniAssistBench(https://huggingface.co/papers?q=OmniAssistBench)。为解决同一用户目标可通过多种路径实现导致的交互路径发散问题,我们向模型提供了源自原始视频的预定义先验信息,要求它们引导用户沿着完全相同的路径操作。由于真实交互视频资源稀缺,我们通过逆向工程现有网络视频构建数据集。我们推导出逻辑用户目标,并将视频分割为多轮片段以模拟连续交互。这套严谨的流程耗费超过1000专家工时才完成数据集构建。实验结果显示,专有模型Gemini-3-Pro在满分100分中获得66.4分,而开源模型Qwen3-Omni-Instruct获得51.2分。尽管当前模型普遍能理解用户输入,但经常给出错误或不完整的回答。具体而言,它们在处理视觉提示(https://huggingface.co/papers?q=visual%20prompts)(如手势)时存在困难,在多轮交互(https://huggingface.co/papers?q=multi-turn%20interactions)中未能保持历史上下文(https://huggingface.co/papers?q=historical%20context),且无法延迟响应直到目标事件发生。结果表明,在模型成为可靠助手之前仍有巨大改进空间。

查看arXiv页面(https://arxiv.org/abs/2608.21360)查看PDF(https://arxiv.org/pdf/2608.21360)项目页面(https://xianyunsun.github.io/OmniAssistBench/)GitHub5(https://github.com/XianyunSun/OmniAssistBench)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.21360)

在您的代理中获取此论文:

hf papers read 2608\.21360

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.21360即可从本页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.21360即可从本页面链接。

引用此论文的空间0

无空间链接此论文

在空间README.md中引用arxiv.org/abs/2608.21360即可从本页面链接。

包含此论文的合集0

无合集包含此论文

将此论文添加到合集(https://huggingface.co/new-collection)即可从本页面链接。

相似文章

Omni-DuplexEval: 评估实时双工全模态交互

Hugging Face Daily Papers

本文介绍了Omni-DuplexEval,这是一个用于多模态大语言模型中实时双工交互的基准测试和自动评估框架,旨在评估流式场景下的连续响应生成和主动事件检测。