基于随机Hessian估计的全参考图像质量指标率失真优化

Hugging Face Daily Papers 论文

摘要

本文提出了一种方法,通过使用随机Hessian估计将全参考图像质量指标近似为输入依赖的二次失真,将其集成到视频编解码器的率失真优化中,从而在VVC中实现BD率节省。

基于块的视频编解码器通过优化率失真权衡来基于输入选择编码参数。传统的失真选择,平方误差和(SSE),简化了参数选择:SSE是块级SSE的总和,因此率失真优化(RDO)可以独立处理块。另一方面,全参考图像质量评估(FR-IQA)指标如MS-SSIM或LPIPS通常比SSE更符合人类视觉系统,但它们不能在循环中使用:它们不能块级分解,并且通常需要完全解码的图像作为输入。基于指标二次化的现有结果,我们通过输入依赖的二次失真(IDQD)来近似广泛的FR-IQA指标,其二次形式矩阵来源于源视频上评估的指标的Hessian。为了使失真可计算块级,我们提出了Hessian矩阵的两种近似:1)保持块对角,2)仅保持其对角线。我们提出了两种估计器,它们只需要通过自动微分获得的Hessian的矩阵向量乘积。在VVC中针对Kodak和CLIC的五个指标,IDQD-RDO在目标指标下实现了14.2-36.7%的BD率节省,无需解码器更改,并带来10-30%的编码复杂度开销。
查看原文
查看缓存全文

缓存时间: 2026/09/25 03:46

论文页面 - 基于随机Hessian估计的全参考图像质量指标率失真优化

来源:https://huggingface.co/papers/2609.30077

摘要

基于块的视频编解码器通过优化率失真权衡,根据输入选择编码参数。传统的失真选择——平方误差和(SSE)简化了参数选择过程:SSE是各块SSE的总和,因此率失真优化(RDO)可以独立处理每个块。而全参考图像质量评估(FR-IQA)指标(如MS-SSIM或LPIPS)通常比SSE更符合人类视觉系统,但无法用于环路内:它们不能按块分解,且通常需要完全解码的图像作为输入。在现有度量二次化成果的基础上,我们通过输入依赖二次失真(IDQD)近似了一大类FR-IQA指标,其二次型矩阵源自在源视频上评估的该度量的Hessian矩阵。为使失真能按块计算,我们提出了两种Hessian矩阵近似方法:1)保留块对角结构;2)仅保留对角线。针对这两种方法,我们设计了估计器,仅需通过自动微分获得的Hessian矩阵进行矩阵-向量乘积运算。在VVC的Kodak和CLIC测试集上,针对五种指标的评估显示,IDQD-RDO在目标指标下实现了14.2-36.7%的BD-rate节省,无需修改解码器,但带来了10-30%的编码复杂度开销。

查看arXiv页面(https://arxiv.org/abs/2609.30077)查看PDF(https://arxiv.org/pdf/2609.30077)GitHub0(https://github.com/sf219/RDO_IQA_FR)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.30077)

通过代理获取本文:

hf papers read 2609\.30077

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型关联本文

在模型README.md中引用arxiv.org/abs/2609.30077以从此页面建立链接。

引用本文的数据集0

无数据集关联本文

在数据集README.md中引用arxiv.org/abs/2609.30077以从此页面建立链接。

引用本文的Spaces0

无Space关联本文

在Space README.md中引用arxiv.org/abs/2609.30077以从此页面建立链接。

包含本文的收藏0

无收藏包含本文

将本文添加到收藏(https://huggingface.co/new-collection)以从此页面建立链接。

相似文章

量化键偷走注意力:视频扩散中KV缓存压缩的偏差校正

arXiv cs.LG

本文指出,在分块自回归视频扩散的KV缓存压缩中,对键进行量化会导致注意力权重出现偏差,并提出了一种每注意力分数校正方法,该方法以可忽略的开销消除偏差,在INT2量化下恢复接近BF16的视频质量。

基于局部分布还原的高精度低位KV缓存量化

arXiv cs.LG

本文发现低位KV缓存量化会因logits的结构化局部误排名而降低大语言模型精度,提出DGAP方法,通过恢复Top-K候选的局部分布,在Llama-3.1-8B模型上将RULER准确率从47.8%恢复至83.2%,且仅增加极小的开销。

基于隐式神经表示的数据驱动视频编解码器

arXiv cs.AI

本文提出一种视频编解码器,将视频和音频存储为正弦表示网络(SIREN)的权重,利用知识蒸馏和量化进行压缩。实验显示,与原始网络相比压缩比为2.61倍,但质量落后于H.264和HEVC等标准编解码器。