Omni-Streaming Thinking
摘要
Omni-Streaming Thinking 通过推迟声明直到跨模态验证来改进流式全模态推理,减少过早承诺和听觉幻觉。
查看缓存全文
缓存时间: 2026/09/15 02:39
论文页面 - Omni-Streaming Thinking
来源:https://huggingface.co/papers/2609.15128
摘要
Omni-Streaming Thinking 通过延迟主张的确认直到完成跨模态验证,改进了流式全模态推理,减少了过早判断和听觉幻觉。
流式(https://huggingface.co/papers?q=Streaming)全模态模型(https://huggingface.co/papers?q=omni-modal%20models)必须根据已观察到的视频片段和同步音频来决定回答什么以及何时回答。视觉线索通常在话语或声音事件完成之前就能支持某种解释。如果该解释作为事实进入记忆,后续推理可能会持续传递它,即使后来音频证据与之矛盾。我们称这种失败为过早跨模态判断(https://huggingface.co/papers?q=cross-modal%20commitment)。我们提出了 Omni-Streaming Thinking(https://huggingface.co/papers?q=Omni-Streaming%20Thinking)(OST),它生成结构化输出,包括迄今观察到的证据、对未来证据的预测以及基于此证据的主张。每个主张最初被标记为待定,并链接到一个未来的验证区间(https://huggingface.co/papers?q=verification%20interval)。音频和视觉证据分开存储,OST 在指定的验证区间结束时,根据特定模态的证据来检查主张。当检测到矛盾证据时,一个反驳过程(https://huggingface.co/papers?q=refutation%20process)会降低该主张及其依赖状态的影响,然后引导使用新证据更新状态。一个回答门控(https://huggingface.co/papers?q=answer%20gate)决定关键主张是否满足给出回答的条件。使用冻结的 Qwen3-Omni-30B-A3B-Instruct(https://huggingface.co/papers?q=Qwen3-Omni-30B-A3B-Instruct)骨干网络并进行轻量级适配,OST 在五个流式(https://huggingface.co/papers?q=streaming)和视听基准测试上,平均性能比最强的开源基线高出 10% 以上。我们还引入了 OST-DiagBench(https://huggingface.co/papers?q=OST-DiagBench),该基准固定视频并编辑音频以测试一致性、缺失、矛盾、共存和字幕-语音冲突。OST 达到了 d-prime(https://huggingface.co/papers?q=d-prime)= 2.95,而开源基线最高仅为 1.38,同时减少了视觉诱导的听觉幻觉(https://huggingface.co/papers?q=vision-induced%20auditory%20hallucinations)。
查看 arXiv 页面 (https://arxiv.org/abs/2609.15128) 查看 PDF (https://arxiv.org/pdf/2609.15128) 项目主页 (https://enjundu.com/blog/ost/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.15128)
通过您的代理获取此论文:
hf papers read 2609.15128
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
暂无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.15128 即可从此页面链接。
引用本文的数据集 0
暂无数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.15128 即可从此页面链接。
引用本文的 Space 0
暂无 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.15128 即可从此页面链接。
包含本文的收藏 0
暂无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
LatentOmni:通过统一视听潜在推理重新思考全模态理解
LatentOmni提出了一种用于视听推理的统一潜在空间,避免了基于文本的思维链带来的信息损失。在视听推理基准测试中,它在开源模型中达到了最先进的性能。
原生主动感知作为全模态理解的推理方式
介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。
OmniPro:面向全主动流式视频理解的综合基准
OmniPro 是首个用于评估全模态大语言模型中主动流式视频理解的基准,包含 2,700 个样本,覆盖多种任务和双模式评估协议。
OmniInteract:面向实时全模态助手的真实世界流式交互基准测试
OmniInteract 提出了一个面向实时全模态大语言模型的流式基准测试,评估在线音视频处理能力,要求具备时间定位和交互式响应。实验表明,当前模型表现不佳,最佳整体 IA-QTF1 分数仅为 0.368。
TLive-Omni:一个用于电子商务直播的全模态理解模型
TLive-Omni 是一款专为电子商务直播设计的全模态理解模型,它整合图像、视频、音频和文本输入以实现实时理解,通过带时间戳的令牌分组与强化微调提升准确性和表达质量。