MLVC:用于实际部署的多平台学习型视频编解码器

Papers with Code Trending 论文

摘要

MLVC是一款硬件鲁棒的神经视频编解码器,专为实际跨平台部署而设计。在视频会议场景中,它比硬件HEVC的BD-rate(MOS)提升超过70%,同时在Apple、Intel和Qualcomm的商用NPU上以100 FPS运行。

神经视频编解码器在编码效率上已经超越经典编解码器,但由于跨平台不兼容和高计算成本,实际部署仍不可行。现有的基于量化的解决方案无法在不同硬件平台上产生确定性结果,导致灾难性的解码失败。我们提出了MLVC,一种为实际跨平台推理设计的硬件鲁棒神经视频编解码器。其关键思想是通过超先验显式传输缩放参数,从而在不要求比特精确运算的情况下保证跨设备的熵编码一致性。虽然这会增加码率开销,但我们通过架构改进(门控记忆、ReGLU激活)、长期参考恢复机制和领域专用感知训练恢复了大部分编码效率。在VCD视频会议基准测试中,MLVC相比硬件HEVC(最强的可部署基线)取得了超过70%的BD-rate(MOS)提升,同时达到与DCVC-RT竞争的主观质量,而DCVC-RT无法在多种平台上运行。编码器和解码器在Apple、Intel和Qualcomm的商用NPU上平均以100 FPS运行。MLVC是首个将竞争性压缩性能、实时速度和跨平台鲁棒性结合在多种消费设备上的神经视频编解码器,使其适合大规模部署。代码将发布。
查看原文
查看缓存全文

缓存时间: 2026/08/05 01:35

论文页面 - MLVC:面向实际部署的多平台学习型视频编解码器

来源:https://huggingface.co/papers/2606.28027

摘要

神经视频编解码器在编码效率上已超越经典编解码器,但由于跨平台不兼容和高计算成本,仍难以实际部署。现有的基于量化的方案无法在多样化的硬件平台上产生确定性结果,从而导致灾难性的解码失败。我们提出了 MLVC,一种为实际跨平台推理设计的硬件鲁棒神经视频编解码器。其关键思想是通过超先验显式传输缩放参数,从而在不要求位精确算术的情况下保证跨设备的熵编码一致性。虽然这会增加码率开销,但我们通过架构改进(门控记忆、ReGLU 激活)、长期参考恢复机制和特定领域的感知训练,恢复了大部分编码效率。在 VCD 视频会议基准测试中,MLVC 相较于最强的可部署基线硬件 HEVC 实现了 >70% 的 BD-rate(MOS)提升,同时主观质量可与 DCVC-RT 相媲美,而 DCVC-RT 无法跨多种平台运行。编码器和解码器在 Apple、Intel 和 Qualcomm 的商用 NPU 上平均以 100 FPS 运行。MLVC 是首个将具竞争力的压缩性能、实时速度和跨平台鲁棒性结合在多样化消费设备上的神经视频编解码器,使其适合大规模部署。代码将发布。

查看 arXiv 页面 (https://arxiv.org/abs/2606.28027)查看 PDF (https://arxiv.org/pdf/2606.28027)GitHub276 (https://github.com/microsoft/mlvc)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2606.28027)

在您的智能体中获取此论文:

hf papers read 2606\.28027

还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.28027,即可从此页面链接到该模型。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.28027,即可从此页面链接到该数据集。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.28027,即可从此页面链接到该 Space。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集,即可从此页面链接到该收藏集。

相似文章

Mage-VL:一种高效的编解码原生流式多模态基础模型

Hugging Face Daily Papers

Mage-VL 是一种高效的编解码原生流式多模态基础模型,通过自定义分词器将视觉标记消耗减少超过75%,在静态和视频任务上与现有模型持平或更优的同时,实现高达3.5倍的推理加速。

AdaCodec:面向视频多模态大模型的预测性视觉编码

Hugging Face Daily Papers

AdaCodec 通过仅在场景预测失败时传输完整视觉标记,否则使用紧凑的帧间变化描述,从而减少多模态大模型中的视频编码冗余。在匹配的标记预算下,它优于逐帧 RGB 基线,并且在使用显著更少标记的情况下取得更好或相当的结果,将首令牌延迟从 9.26 秒降至 1.62 秒。

实时长视频生成(GitHub仓库)

TLDR AI

NVlabs 发布了 LongLive 2.0,这是一个采用 NVFP4 量化的实时长视频生成并行基础设施,同时支持训练和推理。它达到了 45.7 FPS,并被 ICLR 2026 接收。

VideoChat3: 完全开源的高效且通用的视频理解MLLM

Papers with Code Trending

VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。