omni-modal

标签

Cards List
#omni-modal

Ovis-Embedding:推动通用全模态嵌入的前沿

Hugging Face Daily Papers ↗ · 4天前 缓存

本文介绍了Ovis-Embedding,一种最先进的全模态嵌入模型,它使用共享骨干网络将文本、图像、视频和音频编码到公共表示空间中,在MMEB-v3和MVEB等基准测试上取得了顶级性能。

0 人收藏 0 人点赞
#omni-modal

OmniEcho: 面向具身智能体的空间音频理解

Hugging Face Daily Papers ↗ · 5天前 缓存

OmniEcho引入了一种空间感知的全模态模型和一个新的基准,用于具身智能体的空间音频-视觉感知和导航,实现了最先进的性能。

0 人收藏 0 人点赞
#omni-modal

MiniMax-H3 能否推理物理世界?全模态生成模型评估

Hugging Face Daily Papers ↗ · 2026-09-16 缓存

本文通过引入一个综合框架来评估 MiniMax-H3——一种全模态生成模型——在通过多模态输入推理物理世界方面的能力。评估显示,基于视频的决策推理表现最佳,而基于音频的歧义推理则最弱。

0 人收藏 0 人点赞
#omni-modal

Omni-Streaming Thinking

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

Omni-Streaming Thinking 通过推迟声明直到跨模态验证来改进流式全模态推理,减少过早承诺和听觉幻觉。

0 人收藏 0 人点赞
#omni-modal

TLive-Omni:一个用于电子商务直播的全模态理解模型

Hugging Face Daily Papers ↗ · 2026-08-21 缓存

TLive-Omni 是一款专为电子商务直播设计的全模态理解模型,它整合图像、视频、音频和文本输入以实现实时理解,通过带时间戳的令牌分组与强化微调提升准确性和表达质量。

0 人收藏 0 人点赞
#omni-modal

OmniAssistBench: 针对全能大语言模型的助理式交互基准测试

Hugging Face Daily Papers ↗ · 2026-08-21 缓存

OmniAssistBench 是一个用于评估作为实时视频助理的全能大语言模型的基准测试,揭示当前模型在视觉提示、上下文保持和及时响应方面存在困难。

0 人收藏 0 人点赞
#omni-modal

OmniScientist: 一个全模态、全学科的人工智能科学家

Hugging Face Daily Papers ↗ · 2026-08-13 缓存

OmniScientist 是一个端到端的全模态人工智能科学家,它利用自主代理和全生命周期感知,直接基于异构原始证据开展多学科研究。在36个真实数据案例上的评估显示,它提升了跨多种科学模态的基于证据的发现能力。

0 人收藏 0 人点赞
#omni-modal

Ex-Omni-2D:具有原生视觉呈现的表现力全模态对话模型

Hugging Face Daily Papers ↗ · 2026-08-11 缓存

Ex-Omni-2D 是一个全模态对话框架,通过视觉思维计划和蒸馏流式视频生成器,生成协调一致的文本、语音和参考条件视频响应,实现了实用的质量-效率权衡。

0 人收藏 0 人点赞
#omni-modal

OmniPack:面向高效全模态大语言模型的统一令牌压缩

Hugging Face Daily Papers ↗ · 2026-08-04 缓存

OmniPack提出了一种无需训练的全模态大语言模型令牌压缩框架,将LLM前结构化压缩与LLM内任务相关语义精炼相结合,在多个基准上实现了优异的性能-效率权衡。

0 人收藏 0 人点赞
#omni-modal

OmniDelta: 面向OmniLLM令牌压缩的技能驱动预算分配

Hugging Face Daily Papers ↗ · 2026-07-28 缓存

OmniDelta提出了一种无需训练、技能驱动的框架,用于在OmniLLM的音频和视频模态间分配令牌预算,在保留25%令牌时实现了GPU内存减少22%和1.64倍加速,改善了精度-效率权衡。

0 人收藏 0 人点赞
#omni-modal

实时全模态交互驱动的全身移动操作

Reddit r/singularity ↗ · 2026-07-20 缓存

Unitree发布UnifoLM-OminiA-0.3,一个用于全身移动操作的单一AI模型,具备实时全模态交互,可实现自主家庭护理与健康任务。

0 人收藏 0 人点赞
#omni-modal

OmniFocus: 查询引导的模态平衡令牌压缩方法用于全模态大语言模型

arXiv cs.LG ↗ · 2026-07-07 缓存

OmniFocus 是一种无需训练、查询引导的令牌压缩方法,用于全模态大语言模型,它独立估计视频和音频的重要性,以保留模态特定的证据同时保持对齐,在低令牌保留比率下实现了显著的推理加速,同时精度损失极小。

0 人收藏 0 人点赞
#omni-modal

全模态密集视频字幕生成的并行自回归解码

Hugging Face Daily Papers ↗ · 2026-07-03 缓存

本文介绍了PadCaptioner,一个3B参数的全模态密集视频字幕模型,采用并行自回归解码实现高效率和高品质,性能超越7B参数模型。通过利用事件间的弱局部依赖关系,潜在规划机制实现了无损并行生成。

0 人收藏 0 人点赞
#omni-modal

CogniRoute:在全模态模型中学习路由社交证据

Hugging Face Daily Papers ↗ · 2026-06-18 缓存

CogniRoute 是一个基于模式引导的专家混合框架,用于社交视频问答,通过认知模式分解和路由感知的强化学习提升了多模态推理能力。在新的 OmniSocialBench 基准上,它相较于基线取得了显著提升。

0 人收藏 0 人点赞
#omni-modal

原生主动感知作为全模态理解的推理方式

Hugging Face Daily Papers ↗ · 2026-06-17 缓存

介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。

0 人收藏 0 人点赞
#omni-modal

MODF-SIR:面向社会智能推理的多智能体全能模态蒸馏框架

arXiv cs.AI ↗ · 2026-06-11 缓存

本文提出MODF-SIR,一个基于轻量级多模态大语言模型的多智能体协作框架,用于社会智能推理。它采用知识蒸馏、长尾事件提取和测试时自适应,以更少的训练数据实现了最先进的结果。

0 人收藏 0 人点赞
#omni-modal

OmniCap-IF:全模态视频字幕生成中指令跟随能力的基准测试与提升

Hugging Face Daily Papers ↗ · 2026-06-07 缓存

介绍了OmniCap-IF,这是首个用于评估全模态视频字幕生成中指令跟随能力的综合性基准,揭示了格式-内容权衡,并提出了改进的模型和数据集。

0 人收藏 0 人点赞
#omni-modal

TOBench:面向真实世界工具使用智能体的任务导向全模态基准

arXiv cs.AI ↗ · 2026-05-19 缓存

TOBench是一个新的基准测试,用于评估AI智能体在真实世界、任务导向的工具使用中的表现,涉及多模态输入和闭环验证。实验表明,像Qwen 3.5 Plus这样的顶级模型仅达到41%的成功率,远低于94%的人类基准,凸显了显著的差距。

0 人收藏 0 人点赞
#omni-modal

面向高效全模态LLM的阶段自适应Token选择方法

Hugging Face Daily Papers ↗ · 2026-05-19 缓存

SEATS是一种无需训练的阶段自适应Token选择方法,通过逐步剪枝冗余的视觉和音频Token来降低全模态LLM的计算开销,实现了9.3倍FLOPs减少和4.8倍预填充加速,同时保持96.3%的性能。

0 人收藏 0 人点赞
#omni-modal

Qwen3.7预览版登陆Arena(1分钟阅读)

TLDR AI ↗ · 2026-05-19 缓存

阿里巴巴Qwen宣布两大重要模型发布:Qwen3-Omni,首个原生端到端全模态AI,统一处理文本、图像、音频和视频;以及Qwen3-Next-80B-A3B,一款超高效MoE模型,每个token激活30亿参数,实现了SOTA性能,推理速度比Qwen3-32B快10倍。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈