基于随机Hessian估计的全参考图像质量指标率失真优化
摘要
本文提出了一种方法,通过使用随机Hessian估计将全参考图像质量指标近似为输入依赖的二次失真,将其集成到视频编解码器的率失真优化中,从而在VVC中实现BD率节省。
查看缓存全文
缓存时间: 2026/09/25 03:46
论文页面 - 基于随机Hessian估计的全参考图像质量指标率失真优化
来源:https://huggingface.co/papers/2609.30077
摘要
基于块的视频编解码器通过优化率失真权衡,根据输入选择编码参数。传统的失真选择——平方误差和(SSE)简化了参数选择过程:SSE是各块SSE的总和,因此率失真优化(RDO)可以独立处理每个块。而全参考图像质量评估(FR-IQA)指标(如MS-SSIM或LPIPS)通常比SSE更符合人类视觉系统,但无法用于环路内:它们不能按块分解,且通常需要完全解码的图像作为输入。在现有度量二次化成果的基础上,我们通过输入依赖二次失真(IDQD)近似了一大类FR-IQA指标,其二次型矩阵源自在源视频上评估的该度量的Hessian矩阵。为使失真能按块计算,我们提出了两种Hessian矩阵近似方法:1)保留块对角结构;2)仅保留对角线。针对这两种方法,我们设计了估计器,仅需通过自动微分获得的Hessian矩阵进行矩阵-向量乘积运算。在VVC的Kodak和CLIC测试集上,针对五种指标的评估显示,IDQD-RDO在目标指标下实现了14.2-36.7%的BD-rate节省,无需修改解码器,但带来了10-30%的编码复杂度开销。
查看arXiv页面(https://arxiv.org/abs/2609.30077)查看PDF(https://arxiv.org/pdf/2609.30077)GitHub0(https://github.com/sf219/RDO_IQA_FR)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.30077)
通过代理获取本文:
hf papers read 2609\.30077
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型关联本文
在模型README.md中引用arxiv.org/abs/2609.30077以从此页面建立链接。
引用本文的数据集0
无数据集关联本文
在数据集README.md中引用arxiv.org/abs/2609.30077以从此页面建立链接。
引用本文的Spaces0
无Space关联本文
在Space README.md中引用arxiv.org/abs/2609.30077以从此页面建立链接。
包含本文的收藏0
无收藏包含本文
将本文添加到收藏(https://huggingface.co/new-collection)以从此页面建立链接。
相似文章
RateQuant:基于率失真理论的优化混合精度KV Cache量化
本文介绍了 RateQuant,一种用于优化混合精度 KV Cache 量化的方法。该方法利用率失真理论解决失真模型不匹配问题,与 KIVI 和 QuaRot 等现有方法相比,在极低的校准开销下显著降低了困惑度。
向量、乘积和标量量化的统一率失真视角
本文提出了一种针对离散视觉标记化的统一率失真视角,解决了关于量化目标和比较的关键问题,并表明在受控条件下,向量量化实现了最低的失真。
量化键偷走注意力:视频扩散中KV缓存压缩的偏差校正
本文指出,在分块自回归视频扩散的KV缓存压缩中,对键进行量化会导致注意力权重出现偏差,并提出了一种每注意力分数校正方法,该方法以可忽略的开销消除偏差,在INT2量化下恢复接近BF16的视频质量。
基于局部分布还原的高精度低位KV缓存量化
本文发现低位KV缓存量化会因logits的结构化局部误排名而降低大语言模型精度,提出DGAP方法,通过恢复Top-K候选的局部分布,在Llama-3.1-8B模型上将RULER准确率从47.8%恢复至83.2%,且仅增加极小的开销。
基于隐式神经表示的数据驱动视频编解码器
本文提出一种视频编解码器,将视频和音频存储为正弦表示网络(SIREN)的权重,利用知识蒸馏和量化进行压缩。实验显示,与原始网络相比压缩比为2.61倍,但质量落后于H.264和HEVC等标准编解码器。