MLVC:用于实际部署的多平台学习型视频编解码器
摘要
MLVC是一款硬件鲁棒的神经视频编解码器,专为实际跨平台部署而设计。在视频会议场景中,它比硬件HEVC的BD-rate(MOS)提升超过70%,同时在Apple、Intel和Qualcomm的商用NPU上以100 FPS运行。
查看缓存全文
缓存时间: 2026/08/05 01:35
论文页面 - MLVC:面向实际部署的多平台学习型视频编解码器
来源:https://huggingface.co/papers/2606.28027
摘要
神经视频编解码器在编码效率上已超越经典编解码器,但由于跨平台不兼容和高计算成本,仍难以实际部署。现有的基于量化的方案无法在多样化的硬件平台上产生确定性结果,从而导致灾难性的解码失败。我们提出了 MLVC,一种为实际跨平台推理设计的硬件鲁棒神经视频编解码器。其关键思想是通过超先验显式传输缩放参数,从而在不要求位精确算术的情况下保证跨设备的熵编码一致性。虽然这会增加码率开销,但我们通过架构改进(门控记忆、ReGLU 激活)、长期参考恢复机制和特定领域的感知训练,恢复了大部分编码效率。在 VCD 视频会议基准测试中,MLVC 相较于最强的可部署基线硬件 HEVC 实现了 >70% 的 BD-rate(MOS)提升,同时主观质量可与 DCVC-RT 相媲美,而 DCVC-RT 无法跨多种平台运行。编码器和解码器在 Apple、Intel 和 Qualcomm 的商用 NPU 上平均以 100 FPS 运行。MLVC 是首个将具竞争力的压缩性能、实时速度和跨平台鲁棒性结合在多样化消费设备上的神经视频编解码器,使其适合大规模部署。代码将发布。
查看 arXiv 页面 (https://arxiv.org/abs/2606.28027)查看 PDF (https://arxiv.org/pdf/2606.28027)GitHub276 (https://github.com/microsoft/mlvc)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2606.28027)
在您的智能体中获取此论文:
hf papers read 2606\.28027
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.28027,即可从此页面链接到该模型。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.28027,即可从此页面链接到该数据集。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.28027,即可从此页面链接到该 Space。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集,即可从此页面链接到该收藏集。
相似文章
microsoft/Mage-VL · Hugging Face - 一个高效的编解码器原生流式多模态基础模型
微软推出了Mage-VL,这是一个编解码器原生的流式多模态基础模型,用于图像和视频理解。通过采用受视频编解码器启发的稀疏模式,该模型实现了高达3.5倍的推理加速,同时将视觉令牌减少了超过75%。
Mage-VL:一种高效的编解码原生流式多模态基础模型
Mage-VL 是一种高效的编解码原生流式多模态基础模型,通过自定义分词器将视觉标记消耗减少超过75%,在静态和视频任务上与现有模型持平或更优的同时,实现高达3.5倍的推理加速。
AdaCodec:面向视频多模态大模型的预测性视觉编码
AdaCodec 通过仅在场景预测失败时传输完整视觉标记,否则使用紧凑的帧间变化描述,从而减少多模态大模型中的视频编码冗余。在匹配的标记预算下,它优于逐帧 RGB 基线,并且在使用显著更少标记的情况下取得更好或相当的结果,将首令牌延迟从 9.26 秒降至 1.62 秒。
实时长视频生成(GitHub仓库)
NVlabs 发布了 LongLive 2.0,这是一个采用 NVFP4 量化的实时长视频生成并行基础设施,同时支持训练和推理。它达到了 45.7 FPS,并被 ICLR 2026 接收。
VideoChat3: 完全开源的高效且通用的视频理解MLLM
VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。