使用混合摊销推理加速层次化稀疏预测编码

arXiv cs.LG 论文

摘要

本文提出了一种混合摊销推理方法,通过结合快速初始估计和校正优化步骤,加速了层次化稀疏预测编码,比纯迭代或摊销方法更高效。

arXiv:2606.27802v1 Announce Type: new 摘要:层次化预测编码为多层生成模型中的感知提供了一种可解释的框架,作为误差驱动的推理,而稀疏编码通过显式稀疏性约束施加简约的潜在表示。两者的结合产生了具有吸引力的计算和神经科学特性的层次化稀疏预测编码模型,但实际使用往往受限于迭代潜在推理的成本。在这样的模型中,每个输入可能需要多次循环优化步骤才能得到有用的稀疏表示,并且随着层次加深,这一负担更加严重。我们通过固定层次化稀疏能量并改变推理过程来研究这一瓶颈。比较包括四种方案:基于ISTA的经典迭代推理、加速的MFISTA参考、使用适应层次模型的LISTA式自底向上编码器的结构信息摊销推理,以及一种混合方法,其中这种快速摊销初始化之后跟随少量基于能量的校正优化步骤。在此共同目标下,我们在静态图像基准上度量重建质量、稀疏性、延迟和稳定性。结果表明,浅层LISTA式初始化加上短期校正循环优于纯摊销,同时远快于长迭代推理。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:26

# 加速分层稀疏预测编码的混合摊销推理 来源:https://arxiv.org/html/2606.27802 \\corrauthor \[1\]Kazuhisa Fujitakazu@spikingneuron\.net Kazuhisa Fujita 临床工程系,小松大学,10-10 Doihara-Machi,小松市,石川县,日本 923-0921

###### 摘要

分层预测编码为多层生成模型中的基于错误驱动的推理提供了一种可解释的感知框架,而稀疏编码则通过显式的稀疏性约束施加简约的潜在表示。两者的结合产生了分层稀疏预测编码模型,具有令人感兴趣的计算和神经科学特性,但实际应用常常受限于迭代潜在推理的高成本。在这类模型中,每个输入可能需要多次递归精炼步骤才能获得有用的稀疏表示,并且随着层次加深,这一负担变得更加严重。我们通过固定分层稀疏能量并改变推理过程来研究这一瓶颈。比较包括四种方案:基于ISTA的经典迭代推理、加速的MFISTA参考方法、适用于分层模型的结构化感知的LISTA式自底向上编码器的摊销推理,以及一种混合方法,其中这种快速的摊销初始化后跟少量基于能量的修正性精炼步骤。在此共同目标下,我们在静态图像基准上测量了重建质量、稀疏性、延迟和稳定性。结果表明,浅层LISTA式初始化器加上短时间的修正递归优于纯摊销方法,同时仍比长迭代推理快得多。

## 1 引言

感知可以被表述为对潜在原因的推理。一个有用的模型应能高效可靠地恢复这些原因,同时保持表示的可解释性。预测编码将这一过程视为分层误差最小化:自顶向下的预测与自底向上的输入进行比较,残差预测误差在层次结构中传播(Rao and Ballard,,1999 (https://arxiv.org/html/2606.27802#bib.bib24);Friston and Kiebel,,2009 (https://arxiv.org/html/2606.27802#bib.bib14))。而稀疏编码则用超完备字典中少量活跃系数来解释感觉信号。这产生了高效且具有生物学意义的表示;在自然图像上,稀疏编码能够恢复类似于初级视觉皮层中简单细胞感受野的局部化、方向性、带通特征(Olshausen and Field,,1996 (https://arxiv.org/html/2606.27802#bib.bib22))。这两种传统是兼容的。预测编码提供了分层生成结构和局部误差驱动推理;稀疏编码提供了显式的稀疏性先验和单元间的竞争。它们的结合催生了分层稀疏预测编码模型,最著名的是稀疏深度预测编码(SDPC),该模型将层内的递归稀疏推理与跨层的前馈和反馈交互相结合(Boutin et al.,,2021 (https://arxiv.org/html/2606.27802#bib.bib9))。SDPC可以学习定向的低级感受野、更复杂的高级特征以及诸如轮廓整合等上下文敏感效应,从而支持分层稀疏预测编码同时作为一个计算和神经科学框架(Boutin et al.,,2021 (https://arxiv.org/html/2606.27802#bib.bib9))。主要实际弱点是推理引擎。标准公式要求针对每个输入求解稀疏正则化的逆问题,通常通过ISTA或相关近端方法(Daubechies et al.,,2004 (https://arxiv.org/html/2606.27802#bib.bib11);Beck and Teboulle, 2009a, (https://arxiv.org/html/2606.27802#bib.bib6);Beck and Teboulle, 2009b, (https://arxiv.org/html/2606.27802#bib.bib7))。这些方法原理完善,但可能代价高昂:每个新输入可能需要许多精炼步骤才能达到有用的潜在状态。在更深的层次结构中,成本变得更加严重,延迟、不稳定性和重复的内循环优化可能主导系统。递归稀疏推理也被作为一种具有阈值动态和局部竞争的神经计算模型进行研究(Rozell et al.,,2008 (https://arxiv.org/html/2606.27802#bib.bib27))。对此瓶颈的一个自然改进是摊销,特别是当摊销映射保留了原始稀疏优化问题的结构时。在稀疏推理中,学习ISTA(LISTA)通过算法展开将许多类似ISTA的优化步骤替换为一个学习到的前馈网络,从而产生一个结构化的近似稀疏编码的摊销预测器(Gregor and LeCun,,2010 (https://arxiv.org/html/2606.27802#bib.bib16))。更广泛地,在预测编码中,混合预测编码展示了摊销和迭代推理如何优化同一个目标,结合快速前馈初始化与递归精炼(Tschantz et al.,,2023 (https://arxiv.org/html/2606.27802#bib.bib28))。我们研究如何为静态图像的分层稀疏预测编码配备更快、更稳定的推理。我们以推理机制(而非图像架构或稀疏目标)作为实验变量。目标、模型族和评估协议保持固定,以便在相同基于能量的公式下比较迭代推理、LISTA式摊销推理以及混合摊销加迭代推理。本文贡献包括:为静态图像上的分层稀疏预测编码建立一个固定目标的基准;统一比较迭代推理、LISTA式摊销推理和混合推理;以及对其质量-延迟-稳定性权衡的经验分析。

## 2 相关工作

### 2.1 稀疏编码与字典学习

稀疏编码为高效表示学习提供了一个基础框架。它将感知视为从大量超完备字典中少量活跃特征进行的重建。Olshausen和Field(1996 (https://arxiv.org/html/2606.27802#bib.bib22))的开创性工作表明,在自然图像上训练的稀疏编码学习到的基函数类似于初级视觉皮层的感受野。因此,它既成为有用的特征提取方法,也成为早期视觉的生物合理模型。后续大量工作集中于可扩展优化和字典学习。迭代收缩-阈值方法及其加速变体成为解决底层\(\ell_1\)正则化逆问题的标准工具(Beck and Teboulle, 2009a, (https://arxiv.org/html/2606.27802#bib.bib6);Beck and Teboulle, 2009b, (https://arxiv.org/html/2606.27802#bib.bib7))。相关工作开发了适用于更大规模的在线字典学习方法(Mairal et al.,,2010 (https://arxiv.org/html/2606.27802#bib.bib20))。其他工作也将基于块的稀疏编码扩展到卷积设置,后者由于更直接地建模平移结构而更适合图像(Bristow et al.,,2013 (https://arxiv.org/html/2606.27802#bib.bib10))。这些发展使稀疏编码更加实用,但并未消除其核心推理瓶颈:获取稀疏潜在编码通常仍需要对每个输入进行迭代优化。

### 2.2 预测编码与基于自由能的推理

预测编码通常被表述为分层生成模型中的近似推理框架(Rao and Ballard,,1999 (https://arxiv.org/html/2606.27802#bib.bib24);Friston,,2005 (https://arxiv.org/html/2606.27802#bib.bib13);Friston and Kiebel,,2009 (https://arxiv.org/html/2606.27802#bib.bib14))。在经典分层公式中,高级皮层区域向低级区域发送预测,而低级区域则返回预测与观察活动之间的不匹配,即预测误差(Rao and Ballard,,1999 (https://arxiv.org/html/2606.27802#bib.bib24);Friston,,2005 (https://arxiv.org/html/2606.27802#bib.bib13);Bastos et al.,,2012 (https://arxiv.org/html/2606.27802#bib.bib5))。预测与误差之间的递归交换随后迭代更新潜在表示,使其更好地解释感觉输入(Rao and Ballard,,1999 (https://arxiv.org/html/2606.27802#bib.bib24);Friston,,2005 (https://arxiv.org/html/2606.27802#bib.bib13))。这一工作后来被泛化到自由能框架内,其中感知推理被写为在分层生成模型下最小化变分目标(Friston and Kiebel,,2009 (https://arxiv.org/html/2606.27802#bib.bib14))。这些公式在计算神经科学中具有吸引力,因为推理和学习都可以用基于预测误差的局部消息传递来描述(Friston,,2005 (https://arxiv.org/html/2606.27802#bib.bib13);Bastos et al.,,2012 (https://arxiv.org/html/2606.27802#bib.bib5))。后来的工作还表明,在适当条件下,预测编码风格的网络可以近似反向传播(Whittington and Bogacz,,2017 (https://arxiv.org/html/2606.27802#bib.bib29);Rosenbaum,,2022 (https://arxiv.org/html/2606.27802#bib.bib26))。相关的自上而下调制机制也在生物启发的视觉模型中得到了研究,包括初级视觉皮层中任务相关信息的动态门控以及高级和低级视觉区域之间面向分类的交互(Kamiyama et al.,,2016 (https://arxiv.org/html/2606.27802#bib.bib17);Abe et al.,,2018 (https://arxiv.org/html/2606.27802#bib.bib1);Kashimori et al.,,2007 (https://arxiv.org/html/2606.27802#bib.bib18))。在此,预测编码既作为神经科学理论,也作为算法模板具有重要意义。它提供了分层结构、局部误差驱动更新和自然的迭代推理过程。然而,标准预测编码网络每个输入需要多次递归步骤,使得深层推理成本高昂且有时难以稳定(Tschantz et al.,,2023 (https://arxiv.org/html/2606.27802#bib.bib28))。

### 2.3 桥接预测编码与稀疏分层生成模型

几项工作强调了预测编码与稀疏编码之间的兼容性。预测编码贡献了分层生成结构和误差驱动推理;稀疏编码贡献了显式的稀疏性先验和潜在单元间的竞争。这促使了在预测编码风格的自上而下和自底向上交互中嵌入稀疏潜在推理的模型。一个代表性例子是稀疏深度预测编码(SDPC),它在分层卷积架构中结合了跨层的预测编码与层内的稀疏递归推理(Boutin et al.,,2021 (https://arxiv.org/html/2606.27802#bib.bib9))。SDPC可以学习定向的低级感受野、结构化的高级表示以及轮廓整合等上下文敏感效应。因此,它表明预测编码和稀疏编码可以在一个单一的模型族中统一起来,用于真实的图像数据。同时,它也说明了这种方法的主要实际局限性:推理仍然是递归且昂贵的,特别是随着模型深度和复杂性的增加(Boutin et al.,,2021 (https://arxiv.org/html/2606.27802#bib.bib9))。

### 2.4 算法展开与学习稀疏推理

另一条密切相关的工作来自稀疏推理的算法展开。LISTA表明,ISTA的迭代可以展开成一个有限深度的神经网络,其参数从数据中学习,从而将缓慢的迭代优化替换为近似稀疏编码的快速前馈(即摊销)推理(Gregor and LeCun,,2010 (https://arxiv.org/html/2606.27802#bib.bib16))。后续工作阐明并扩展了这一设计空间。例如,展开ISTA的学习步长变体在目标解足够稀疏时,与最先进的学习稀疏推理网络具有竞争力(Ablin et al.,,2019 (https://arxiv.org/html/2606.27802#bib.bib3))。分析性LISTA(ALISTA)进一步表明,即使只学习步长和阈值,也能获得强性能(Liu et al.,,2019 (https://arxiv.org/html/2606.27802#bib.bib19))。尽管取得了这些进展,大多数展开稀疏编码工作集中在单层稀疏恢复上,而非具有显式自上而下生成交互的分层预测编码。这留下了一个开放问题:在多层稀疏生成模型中,如何将快速摊销推理与递归误差修正精炼结合起来?

### 2.5 混合预测编码与摊销加迭代推理

预测编码的最新工作已开始从摊销推理的角度解决这个问题。混合预测编码(HPC)将前馈推理解释为摊销推理,将递归预测编码更新解释为在相同目标下的迭代精炼(Tschantz et al.,,2023 (https://arxiv.org/html/2606.27802#bib.bib28))。它形式化了一个双过程视图:快速前馈通路提供廉价的初始信念,而递归动态在需要更多精炼时提高准确性、上下文敏感性和鲁棒性。HPC提供了强有力的概念先例,但它并未专注于具有显式\(\ell_1\)型潜在稀疏性用于静态图像表示的分层稀疏编码。此外,虽然HPC通常依赖非结构化的黑箱神经网络用于摊销通路,但我们的方法采用结构化的LISTA式编码器,具有源自字典的初始化和学习到的收缩块。HPC确立了在预测编码中结合摊销和迭代推理的一般原则,而稀疏编码则为稀疏目标提供了工具。对于分层稀疏图像模型,这种结合的研究较少。

### 2.6 本工作的定位

我们的工作在建模方面最接近SDPC,在推理方面最接近LISTA和HPC。侧重点不同。相对于SDPC,我们在保持稀疏生成模型固定的情况下改变推理引擎。相对于LISTA及相关展开方法,我们研究分层潜在推理而非单层稀疏恢复。相对于HPC,我们将摊销加迭代推理专门用于静态图像的分层稀疏编码,其中重建质量、稀疏性、延迟和稳定性可以在同一个稀疏能量下进行比较。因此,我们聚焦于一个更窄的问题:当稀疏目标和分层生成模型固定时,应如何结合摊销推理和迭代推理。

## 3 方法

### 3.1 概述

我们比较下面定义的分层稀疏模型的四种推理方案:(i) 作为基本迭代基线的ISTA式迭代推理(Daubechies et al.,,2004 (https://arxiv.org/html/2606.27802#bib.bib11);Beck and Teboulle, 2009a, (https://arxiv.org/html/2606.27802#bib.bib6)),(ii) 作为单调加速迭代基线的MFISTA(Beck and Teboulle, 2009a, (https://arxiv.org/html/2606.27802#bib.bib6)),(iii) 适用于分层模型的共享参数LISTA式摊销自底向上编码器(Gregor and LeCun,,2010 (https://arxiv.org/html/2606.27802#bib.bib16)),以及(iv) 提出的混合方法,其中该编码器提供一个初始化,再通过少量ISTA式步骤进一步精炼。所有四种方法都使用相同的层次

相似文章

通过分层高斯滤波器的闭式预测编码

arXiv cs.LG

本文介绍了通过分层高斯滤波器实现的闭式预测编码,该编码恢复了精度加权的预测误差,从而在没有全局误差信号的情况下实现更快、更高效的训练,并在某些任务上优于反向传播。

混合与循环大语言模型服务中的稀疏前缀缓存

arXiv cs.LG

本文针对混合和循环大语言模型提出了稀疏前缀缓存方法,该方法在有限的检查点位置存储循环状态,从而避免密集缓存,同时最小化重计算量。在真实数据上,该方法优于标准启发式方法,尤其是在请求共享大量但非完全相同的前缀时。

SparDA:用于高效长上下文 LLM 推理的稀疏解耦注意力

arXiv cs.CL

SparDA 提出了一种解耦稀疏注意力架构,通过添加轻量级"Forecast"投影来预测未来的 KV 缓存需求,从而实现从 CPU 到 GPU 的预取(lookahead prefetching),并降低选择开销。在基于稀疏预训练的 8B 模型上,其 prefill 速度最高可提升 1.25×,decode 速度最高可提升 1.7×,相比非 offload 基线,decode 吞吐量最高可提升 5.3×。

利用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理

arXiv cs.LG

本文提出了一种针对具有适度非结构化稀疏性的大语言模型的高效GPU推理方法。引入了一种三层矩阵存储格式和一个联合利用稀疏张量核心与CUDA核心的SpMM内核,实现了相比SpInfer最高1.64倍的内核级加速,以及相比FlashLLM最高1.41倍的端到端加速。