TLive-Omni:一个用于电子商务直播的全模态理解模型
摘要
TLive-Omni 是一款专为电子商务直播设计的全模态理解模型,它整合图像、视频、音频和文本输入以实现实时理解,通过带时间戳的令牌分组与强化微调提升准确性和表达质量。
查看缓存全文
缓存时间: 2026/08/25 04:35
论文页面 - TLive-Omni:面向电商直播的全模态理解模型
来源:https://huggingface.co/papers/2608.20958
摘要
TLive-Omni 是一款面向直播电商的全模态模型,通过基于时间戳的分组标记、阶段性监督训练以及带有可验证反馈的强化微调,实现对图像、视频、音频和文本的统一处理,从而达成精准的实时理解。
电商直播需要对充满噪声、时间跨度长的流媒体内容进行全模态理解(https://huggingface.co/papers?q=omni-modal%20understanding),其中产品信息分散在语音、视频帧、商品图片、叠加文字以及用户提问中。我们推出了 TLive-Omni,这是一款专为直播电商(https://huggingface.co/papers?q=live-commerce)场景定制的全模态理解模型。它将图像、视频、音频和文本输入映射到一个统一的表示空间。针对长时直播分析,我们引入了 Per-vGrid(https://huggingface.co/papers?q=Per-vGrid),这是一种基于时间戳的标记组织方式(https://huggingface.co/papers?q=timestamped%20token%20organization),它将每个视频网格与其时间对应的音频在明确的边界标记内分组,以促进时间对齐。我们设计了一个三阶段监督训练(https://huggingface.co/papers?q=three-stage%20supervised%20training)方案,逐步构建对直播电商(https://huggingface.co/papers?q=live-commerce)的理解能力,从全模态感知到指令跟随响应。随后,我们提出了 Faithful-RFT(https://huggingface.co/papers?q=Faithful-RFT),一个强化微调(https://huggingface.co/papers?q=reinforcement%20fine-tuning)阶段,通过在任务中使用可验证反馈直接对最终回答进行评分,而非在探索过程中优化推理风格,从而在满足实时需求的同时,进一步提升答案的忠实度和表达质量。此外,TLive-Omni 还得到了一个面向场景的原子能力分类体系和一个紧凑型数据生产引擎的支持,该引擎将直播电商(https://huggingface.co/papers?q=live-commerce)的音频、图像和视频流转换为用于语音识别、说话人分析、商品视觉定位(https://huggingface.co/papers?q=product%20visual%20grounding)、文本识别、时间定位(https://huggingface.co/papers?q=temporal%20grounding)、视频密集描述和全模态问答等任务的训练信号。为实现可扩展的训练,一个同步的长度分组采样器(https://huggingface.co/papers?q=length-grouped%20sampler)在保持各工作节点负载相当的同时减少了填充;而一个轻量级的动态采样(https://huggingface.co/papers?q=dynamic%20sampling)策略则重新生成具有近零奖励方差的探索批次,以维持对 GRPO(https://huggingface.co/papers?q=GRPO)有意义的相对优势。在电商直播基准测试上的实验表明,该模型在直播电商(https://huggingface.co/papers?q=live-commerce)领域任务上表现优异,并且在通用基准测试上也展现出出色的泛化能力。
查看 arXiv 页面 (https://arxiv.org/abs/2608.20958) 查看 PDF (https://arxiv.org/pdf/2608.20958) GitHub15 (https://github.com/TaoLiveAIGC/TLive-Omni) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.20958)
在您的智能体中获取此论文:
hf papers read 2608\.20958
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型2
TaoLiveAIGC/TLive-Omni-4B 文本生成• 6B• 更新于1天前 • 189 • 9 (https://huggingface.co/TaoLiveAIGC/TLive-Omni-4B)
TaoLiveAIGC/TLive-Omni-9B 文本生成• 10B• 更新于1天前 • 186 • 8 (https://huggingface.co/TaoLiveAIGC/TLive-Omni-9B)
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.20958 以从本页面链接它。
引用此论文的 Space1
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接它。
相似文章
LatentOmni:通过统一视听潜在推理重新思考全模态理解
LatentOmni提出了一种用于视听推理的统一潜在空间,避免了基于文本的思维链带来的信息损失。在视听推理基准测试中,它在开源模型中达到了最先进的性能。
Light-Omni:带长期记忆的智能体视频理解中反射优先于推理
Light-Omni是一个多模态智能体框架,用于高效视频理解,通过双上下文状态(全局状态和参数化潜在状态)避免迭代推理,实现更快更准确的处理,并显著提升速度和节省内存。
OmniInteract:面向实时全模态助手的真实世界流式交互基准测试
OmniInteract 提出了一个面向实时全模态大语言模型的流式基准测试,评估在线音视频处理能力,要求具备时间定位和交互式响应。实验表明,当前模型表现不佳,最佳整体 IA-QTF1 分数仅为 0.368。
OmniPro:面向全主动流式视频理解的综合基准
OmniPro 是首个用于评估全模态大语言模型中主动流式视频理解的基准,包含 2,700 个样本,覆盖多种任务和双模式评估协议。
Ex-Omni-2D:具有原生视觉呈现的表现力全模态对话模型
Ex-Omni-2D 是一个全模态对话框架,通过视觉思维计划和蒸馏流式视频生成器,生成协调一致的文本、语音和参考条件视频响应,实现了实用的质量-效率权衡。