Omni-Streaming Thinking

Hugging Face Daily Papers 论文

摘要

Omni-Streaming Thinking 通过推迟声明直到跨模态验证来改进流式全模态推理,减少过早承诺和听觉幻觉。

流式全模态模型必须从目前观察到的视频片段和同步音频中决定回答什么以及何时回答。视觉线索通常在话语或声音事件完成之前就支持某种解释。如果该解释作为事实进入记忆,后续推理即使在音频与之矛盾时也可能继续传播它。我们将这种失败称为过早跨模态承诺。我们提出了Omni-Streaming Thinking (OST),它生成结构化输出,包括迄今为止观察到的证据、对未来证据的预测以及基于此证据的声明。每个声明最初被标记为待处理,并链接到未来的验证区间。音频和视觉证据被分开存储,OST在验证区间结束时根据指定模态的证据检查声明。当检测到矛盾证据时,一个反驳过程会减少该声明及其依赖状态的影响,然后使用新证据指导状态更新。一个答案门决定关键答案声明是否满足给出响应的条件。使用冻结的Qwen3-Omni-30B-A3B-Instruct主干网络并进行轻量级适配,OST在五个流式和音视频基准测试上平均相对优于最强开源基线超过10%。我们还引入了OST-DiagBench,它固定视频并编辑音频以测试一致性、缺失、矛盾、共存和字幕-语音冲突。OST达到了d-prime = 2.95,而开源基线最多为1.38,同时减少了视觉诱导的听觉幻觉。
查看原文
查看缓存全文

缓存时间: 2026/09/15 02:39

论文页面 - Omni-Streaming Thinking

来源:https://huggingface.co/papers/2609.15128

摘要

Omni-Streaming Thinking 通过延迟主张的确认直到完成跨模态验证,改进了流式全模态推理,减少了过早判断和听觉幻觉。

流式(https://huggingface.co/papers?q=Streaming)全模态模型(https://huggingface.co/papers?q=omni-modal%20models)必须根据已观察到的视频片段和同步音频来决定回答什么以及何时回答。视觉线索通常在话语或声音事件完成之前就能支持某种解释。如果该解释作为事实进入记忆,后续推理可能会持续传递它,即使后来音频证据与之矛盾。我们称这种失败为过早跨模态判断(https://huggingface.co/papers?q=cross-modal%20commitment)。我们提出了 Omni-Streaming Thinking(https://huggingface.co/papers?q=Omni-Streaming%20Thinking)(OST),它生成结构化输出,包括迄今观察到的证据、对未来证据的预测以及基于此证据的主张。每个主张最初被标记为待定,并链接到一个未来的验证区间(https://huggingface.co/papers?q=verification%20interval)。音频和视觉证据分开存储,OST 在指定的验证区间结束时,根据特定模态的证据来检查主张。当检测到矛盾证据时,一个反驳过程(https://huggingface.co/papers?q=refutation%20process)会降低该主张及其依赖状态的影响,然后引导使用新证据更新状态。一个回答门控(https://huggingface.co/papers?q=answer%20gate)决定关键主张是否满足给出回答的条件。使用冻结的 Qwen3-Omni-30B-A3B-Instruct(https://huggingface.co/papers?q=Qwen3-Omni-30B-A3B-Instruct)骨干网络并进行轻量级适配,OST 在五个流式(https://huggingface.co/papers?q=streaming)和视听基准测试上,平均性能比最强的开源基线高出 10% 以上。我们还引入了 OST-DiagBench(https://huggingface.co/papers?q=OST-DiagBench),该基准固定视频并编辑音频以测试一致性、缺失、矛盾、共存和字幕-语音冲突。OST 达到了 d-prime(https://huggingface.co/papers?q=d-prime)= 2.95,而开源基线最高仅为 1.38,同时减少了视觉诱导的听觉幻觉(https://huggingface.co/papers?q=vision-induced%20auditory%20hallucinations)。

查看 arXiv 页面 (https://arxiv.org/abs/2609.15128) 查看 PDF (https://arxiv.org/pdf/2609.15128) 项目主页 (https://enjundu.com/blog/ost/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.15128)

通过您的代理获取此论文:

hf papers read 2609.15128

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

暂无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.15128 即可从此页面链接。

引用本文的数据集 0

暂无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.15128 即可从此页面链接。

引用本文的 Space 0

暂无 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.15128 即可从此页面链接。

包含本文的收藏 0

暂无收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

原生主动感知作为全模态理解的推理方式

Hugging Face Daily Papers

介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。