TLive-Omni:一个用于电子商务直播的全模态理解模型

Hugging Face Daily Papers 论文

摘要

TLive-Omni 是一款专为电子商务直播设计的全模态理解模型,它整合图像、视频、音频和文本输入以实现实时理解,通过带时间戳的令牌分组与强化微调提升准确性和表达质量。

电子商务直播需要对有噪音、时间跨度长的直播流进行全模态理解,其中产品事实分布在语音、视频帧、产品图像、叠加文本和用户查询中。我们提出了 TLive-Omni,一个专为直播电商场景定制的全模态理解模型。它将图像、视频、音频和文本输入映射到统一的表示空间中。对于长视频直播分析,我们引入了 Per-vGrid,一种带时间戳的令牌组织方式,它将每个视频网格与时间上对应的音频在明确的边界令牌内分组,以促进时间对齐。我们设计了一个三阶段的监督训练方案,逐步发展直播电商理解能力,从全模态感知到遵循指令的响应。然后我们提出了 Faithful-RFT,一个强化微调阶段,它在满足实时需求的同时进一步提高了答案的忠实性和表达质量,通过任务可验证反馈直接对最终响应进行评分,而不是在推出过程中优化推理风格的探索。此外,TLive-Omni 得到了一个面向场景的原子能力分类和一个紧凑数据生成引擎的支持,该引擎将直播电商的音频、图像和视频流转换为语音识别、说话人分析、产品视觉定位、文本识别、时间定位、视频密集描述和全模态问答等训练信号。为了可扩展的训练,一个同步长度分组采样器在保持各工作负载相当的同时减少填充,而一个轻量级动态采样策略以近零奖励方差重新生成推出组,为 GRPO 保持有意义的相对优势。在电子商务直播基准测试上的实验显示了在直播电商领域任务上的强大性能,以及在一般基准测试上的出色泛化能力。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:35

论文页面 - TLive-Omni:面向电商直播的全模态理解模型

来源:https://huggingface.co/papers/2608.20958

摘要

TLive-Omni 是一款面向直播电商的全模态模型,通过基于时间戳的分组标记、阶段性监督训练以及带有可验证反馈的强化微调,实现对图像、视频、音频和文本的统一处理,从而达成精准的实时理解。

电商直播需要对充满噪声、时间跨度长的流媒体内容进行全模态理解(https://huggingface.co/papers?q=omni-modal%20understanding),其中产品信息分散在语音、视频帧、商品图片、叠加文字以及用户提问中。我们推出了 TLive-Omni,这是一款专为直播电商(https://huggingface.co/papers?q=live-commerce)场景定制的全模态理解模型。它将图像、视频、音频和文本输入映射到一个统一的表示空间。针对长时直播分析,我们引入了 Per-vGrid(https://huggingface.co/papers?q=Per-vGrid),这是一种基于时间戳的标记组织方式(https://huggingface.co/papers?q=timestamped%20token%20organization),它将每个视频网格与其时间对应的音频在明确的边界标记内分组,以促进时间对齐。我们设计了一个三阶段监督训练(https://huggingface.co/papers?q=three-stage%20supervised%20training)方案,逐步构建对直播电商(https://huggingface.co/papers?q=live-commerce)的理解能力,从全模态感知到指令跟随响应。随后,我们提出了 Faithful-RFT(https://huggingface.co/papers?q=Faithful-RFT),一个强化微调(https://huggingface.co/papers?q=reinforcement%20fine-tuning)阶段,通过在任务中使用可验证反馈直接对最终回答进行评分,而非在探索过程中优化推理风格,从而在满足实时需求的同时,进一步提升答案的忠实度和表达质量。此外,TLive-Omni 还得到了一个面向场景的原子能力分类体系和一个紧凑型数据生产引擎的支持,该引擎将直播电商(https://huggingface.co/papers?q=live-commerce)的音频、图像和视频流转换为用于语音识别、说话人分析、商品视觉定位(https://huggingface.co/papers?q=product%20visual%20grounding)、文本识别、时间定位(https://huggingface.co/papers?q=temporal%20grounding)、视频密集描述和全模态问答等任务的训练信号。为实现可扩展的训练,一个同步的长度分组采样器(https://huggingface.co/papers?q=length-grouped%20sampler)在保持各工作节点负载相当的同时减少了填充;而一个轻量级的动态采样(https://huggingface.co/papers?q=dynamic%20sampling)策略则重新生成具有近零奖励方差的探索批次,以维持对 GRPO(https://huggingface.co/papers?q=GRPO)有意义的相对优势。在电商直播基准测试上的实验表明,该模型在直播电商(https://huggingface.co/papers?q=live-commerce)领域任务上表现优异,并且在通用基准测试上也展现出出色的泛化能力。

查看 arXiv 页面 (https://arxiv.org/abs/2608.20958) 查看 PDF (https://arxiv.org/pdf/2608.20958) GitHub15 (https://github.com/TaoLiveAIGC/TLive-Omni) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.20958)

在您的智能体中获取此论文:

hf papers read 2608\.20958

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型2

TaoLiveAIGC/TLive-Omni-4B 文本生成• 6B• 更新于1天前 • 189 • 9 (https://huggingface.co/TaoLiveAIGC/TLive-Omni-4B)

TaoLiveAIGC/TLive-Omni-9B 文本生成• 10B• 更新于1天前 • 186 • 8 (https://huggingface.co/TaoLiveAIGC/TLive-Omni-9B)

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.20958 以从本页面链接它。

引用此论文的 Space1

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接它。

相似文章