内核重启:突破神经场中神经切向核的边界

arXiv cs.LG 论文

摘要

本文开发了NTK-KIP、MetaQuill和MetaQuill-KIP算法,以改善从稀疏观测中重建神经场,使基于神经切向核(NTK)的神经场变得非线性和元可学习,从而实现高效的少样本适应。

arXiv:2609.03117v1 公告类型:新 摘要:神经场(NFs)将连续坐标映射到颜色或密度等信号,但从稀疏观测中快速高质量重建仍然困难。经典的神经切向核(NTK)回归提供闭式拟合,但从根本上它是线性的,无法积累可重用的任务先验。我们开发了三种算法来解决这些差距。NTK-KIP学习一个提炼的坐标支持集(和可选标签),使得有限的NTK可以从少量观测数据中填补大的缺失区域,产生一个紧凑的非线性表示,而不是原始的核求解。MetaQuill元学习INR的共享初始化,使得新场景可以通过更新一个小的任务特定权重偏移来适应,这提供了真正的特征学习和可重用的先验。最后,MetaQuill-KIP融合了这两种思想:它以KIP风格的非线性热启动初始化任务,然后仅在那个元学习初始化周围细化小的偏移。MetaQuill-KIP在极稀疏观测下实现了高PSNR重建和语义合理的填补,同时只需要轻量级的每实例适应,而扩散风格的基线通常依赖于大型预训练生成先验和昂贵的每图像调优。这表明基于NTK的神经场可以变得既非线性又元可学习,缩小了解析核与实际少样本重建之间的差距。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:21

# 突破神经场中神经切线核的边界
来源:https://arxiv.org/html/2609.03117

## 核心重启:突破神经场中神经切线核的边界
致谢:通讯作者 A. Mallak: \([email protected]\)  
出版ID:pubid:© 2026 IEEE。允许个人使用此材料。所有其他用途,包括以任何形式重新印刷/重新发布此材料用于广告或促销目的,创建新的集体作品,转售或重新分发至服务器或列表,或将本作品的任何版权组件用于其他作品,均须获得IEEE的许可。  
DOI: 10.1109/TPAMI.2026.3692624。

作者与单位:
- Alaa Maalouf  
  单位:计算机科学系,海法大学  
  单位:计算机科学与人工智能实验室,麻省理工学院
- Lior Wolf  
  单位:计算机科学与人工智能学院,特拉维夫大学
- Daniela Rus 和 Dan Rosenbaum  
  单位:计算机科学系,海法大学  
  单位:计算机科学与人工智能实验室,麻省理工学院

#### 摘要
神经场将连续坐标映射到颜色或密度等信号,但实现从稀疏观测中快速、高质量的重建仍然困难。经典的神经切线核回归提供了闭式解,但它本质上是线性的,无法积累可重用的任务先验知识。我们开发了三种算法来解决这些差距。NTK-KIP学习一个蒸馏后的支持坐标集(以及可选的标签),使得有限的NTK可以从少量观测数据中修补大片缺失区域,从而得到一个紧凑的非线性表示,而非原始的核求解。MetaQuill元学习一个INR的共享初始化,使得新场景可以通过仅更新一个小的特定任务权重偏移量来进行适配,这提供了真正的特征学习和可重用的先验知识。最后,MetaQuill-KIP融合了两种思想:它使用KIP风格的非线性热启动来初始化任务,然后仅在该元学习的初始化周围优化那个小的偏移量。MetaQuill-KIP在极稀疏观测下实现了高PSNR的重建和语义上合理的图像修复,同时仅需轻量级的逐实例适配;而扩散模型基线通常依赖于大型预训练生成先验和昂贵的逐图像调优。这表明由NTK驱动的神经场可以是非线性的并且是可元学习的,从而缩小了分析核与实际少样本重建之间的差距。

#### 索引词:机器学习,表示、数据结构与变换,视觉与场景理解,计算机视觉,知识检索,神经网络。

---

## I 引言

神经场模型,也称为隐式神经表示,是连续函数,将输入的位置坐标(例如空间或时间坐标)直接映射到表示场属性(如颜色、密度或几何)的输出。具体而言,神经场是被设计来学习这种映射的神经网络\[1 (https://arxiv.org/html/2609.03117#bib.bib4), 2 (https://arxiv.org/html/2609.03117#bib.bib1)\]。这些模型在图像表示\[2\]、3D物体重建\[3,4\]、3D场景\[5\]、音频\[6\]等任务中特别有用\[7\]。通常,模型并不直接使用空间坐标作为输入;而是利用这些坐标的**位置编码**,从而提供一个连续的输入空间\[5,8\]。这种方法使得模型能够以内存高效的方式表示复杂的高分辨率场,而无需依赖传统模型中典型的离散网格表示。

神经场成功的关键在于其进行表征学习的能力,使其能够为各种下游任务捕获有用的特征\[9,10\]。这个学习过程高度非线性且难以建模\[10\]。尽管神经场已展现出巨大潜力,但其应用面临两个主要挑战:首先,将数据表示为神经网络权重与下游任务并非天然兼容,并且限制了网络规模;其次,训练过程必须对每个数据样本重复进行,这影响了效率。

**神经切线核。** 神经切线核旨在通过核方法建模神经网络的学习动力学,解释其在梯度下降训练过程中的演变\[11\]。NTK通过围绕初始化点的一阶泰勒展开来近似宽神经网络的动力学。在无限宽度下(在适当的参数缩放条件下),这种近似是精确的;在有限宽度下,它已被证明是网络训练的有用模型,并在核驱动的数据集蒸馏\[12,13,14\]、增量学习\[15\]、回归\[16\]、元学习\[17,18\]等方面显示出应用价值\[19\]。

形式化地,令 \(N > 0\) 为数据集中的样本总数,\(d\) 为每个样本的维度,令 \(x, x' \in \mathbb{R}^d\) 为一对输入样本。令 \(f(x; \theta): \mathbb{R}^d \rightarrow \mathbb{R}^C\) 是一个由任意数量、不同大小层组成的全连接神经网络,具有一组参数 \(\theta\),令 \(L(\hat{y}, y)\) 是预测标签 \(\hat{y}\) 相对于真实标签 \(y\) 的损失函数。NTK推导出 \(f\) 的输出随时间演变表示为:
\[
\nabla_t f(x'; \theta) = -\frac{1}{N} \sum_{i=1}^{n} \mathcal{K}(x, x'; \theta) \nabla_f L(f(x_i, \theta), y_i)
\]
其中,
\[
\mathcal{K}(x, x'; \theta) = \nabla_\theta f(x; \theta)^T \nabla_\theta f(x'; \theta) \quad | \quad \mathcal{K}: \mathbb{R}^d \times \mathbb{R}^d \rightarrow \mathbb{R}^{C \times C} \tag{1}
\]

**从无限宽度神经网络到核岭回归。** 对于在正确参数缩放下的无限宽度神经网络,NTK \(\mathcal{K}(x, x'; \theta)\) 随时间保持不变\[11\],从而允许将时变核替换为常量核 \(\mathcal{K}(x, x')\)。此外,对于多类网络,每个类的核是相同的,可以视为 \(C\) 个值相等的独立核。再者,如果网络在均方误差损失下用 \(N\) 个输入数据点(每个有 \(C\) 个标签)进行训练,这会导致一个闭式解,即核岭回归。我们有完整的核矩阵 \(\mathcal{K} \in \mathbb{R}^{N \times N}\),其元素在位置 \(\mathcal{K}_{i,j}\) 为对应的 \(\mathcal{K}(x_i, x_j)\),目标为 \(Y \in \mathbb{R}^{N \times C}\)。我们寻求一个最优参数 \(W\) 以最小化经验损失。形式化地:
\[
W := \underset{W' \in \mathbb{R}^{N \times C}}{\arg\min} \| Y - \mathcal{K} W' \|_2^2
\]
求解最优 \(W'\):
\[
\mathcal{W} = \mathcal{K}^{-1} \mathcal{Y} \tag{2}
\]
预测新数据点 \(x'\) 的输出,通过计算其相对于训练数据集的核 \(\mathcal{K}(x', x) \in \mathbb{R}^{1 \times N}\),其位置 \(i\) 处的元素为 \(\mathcal{K}(x', x_i)\)。输出则为:
\[
\hat{\mathcal{Y}} = \mathcal{K}(x', x) \mathcal{W} \tag{3}
\]

这种方法不仅作为神经网络训练的模型有用,而且省去了训练模型的需要,这对于非常大的模型可能更快,代价是需要反转核矩阵。

**用于表征学习的NTK。** 受益于NTK的优势,我们研究将NTK作为训练神经场的模型。具体来说,使用神经场在数据集上进行表征学习需要训练多个神经场,每个神经场代表单个数据样本,因此,直观地,这些多神经场模型可以通过NTK方法用单个核矩阵来替代和表示。此外,这使得神经场能够利用NTK的所有显著优势,例如使用无限宽度层(提供高维参数空间和模型灵活性)、闭式核回归(使训练和推理像矩阵求逆一样简单),以及在特定表征学习应用中的实用性(如训练多神经网络模型)。

**NTK神经场矩阵补全。** 神经场常用于修复/矩阵补全任务。在这种情况下,模型被给予不完整的数据,例如图像仅有一部分像素,模型必须修复缺失的像素。对于矩阵补全任务\[20\],由于需要为缺失像素计算核矩阵,重建目标图像的算法略有不同。令目标图像的观测(已知)像素为 \(o\),假设真实图像的形状为 \((h, w, C)\)。为了计算 \(W \in \mathbb{R}^{o \times C}\):
\[
\mathcal{W} = \mathcal{K}_{train}^{-1} \mathcal{Y} \quad | \quad \mathcal{K}_{train} \in \mathbb{R}^{o \times o}, \quad \mathcal{Y} \in \mathbb{R}^{o \times C} \tag{4}
\]
其中 \(\mathcal{K}_{train}\) 以模型的权重和神经场观测到的位置编码(仅对应于目标图像观测像素的位置编码)作为输入。为了重建真实图像:
\[
\hat{\mathcal{Y}} = \mathcal{K}_{test} \mathcal{W} \quad | \quad \mathcal{K}_{test} \in \mathbb{R}^{(h \cdot w) \times o}, \quad \hat{\mathcal{Y}} \in \mathbb{R}^{(h \cdot w) \times C} \tag{5}
\]
其中 \(\mathcal{K}_{test}\) 以模型的权重以及神经场的观测和完整的位置编码作为输入。

**为何改进NTK而非放弃它。** NTK风格的神经场求解器仍然具有吸引力,因为它们提供了分析性的、闭式的信号拟合控制、极快的逐实例适配,以及对观测坐标的透明条件化,且无需大型预训练生成先验。这使得它们在设备端个性化或单场景重建等场景中具有吸引力,在这些场景中,我们无法假设能访问到大型扩散骨干网络或文本语义先验。问题在于经典NTK流程存在根本局限性:它们在函数空间中是线性的(因此无法表示丰富的结构),并且无法跨任务元学习可重用的特征。因此,这项工作的核心目标并非主张仅靠NTK就能超越现代扩散模型,而是要证明NTK中的这两个结构性缺陷在实践中可以被弥合。NTK-KIP通过蒸馏一组紧凑的特定任务诱导点注入了非线性的表征能力,而MetaQuill提供了真正的特征学习和元初始化,使得新任务可以在几步内完成适配。它们的融合——MetaQuill-KIP——统一了这两种效果,将NTK风格的神经场转变为实用、快速适配、逐实例的重建器。

### I-A 我们的贡献

我们研究了神经切线核在神经场表征学习中的实际应用,并询问NTK风格的方法能否变得快速、可学习,并适用于单图像重建和修复等任务。我们首先用NTK回归取代了缓慢的神经场训练,这原则上为拟合一个(有效的)无限宽度神经场提供了一步解决方案。我们的初步分析揭示,当标准NTK流程直接应用于神经场时,存在根本性的缺陷。我们的第一个贡献是对这些局限性的系统性研究:
- • **NTK表征局限性**:由于NTK在固定初始化周围的权重空间中拟合线性函数,其预测在结构上受限。这阻碍了许多真实信号中高频结构和精细语义细节的重建(参见第II-A节)。
- • **NTK缺乏鲁棒性**:显式核回归解对噪声和掩码高度敏感,在部分观测设置(如修复)中表现不佳,即使中等程度的缺失区域也会降低输出平滑度和语义合理性(参见第II-B节)。
- • **NTK效率低下**:在密集神经场网格上的有限宽度NTK需要形成或应用大的雅可比块。这导致高内存使用和不菲的求解成本,使得朴素的NTK对于实际的、迭代式的适配没有吸引力(参见第II-C节)。

为了解决这些问题,我们开发并评估了三种NTK驱动的算法:
1. **NTK-KIP:蒸馏的非线性NTK表示。** 我们引入了神经切线核核诱导点,它将NTK拟合从“在每个像素上求解”转变为“学习一个小支持集并仅在那里求解”。NTK-KIP学习一组紧凑的空间支持坐标和(可选的)其关联的目标值,通过NTK对它们进行优化。这相当于将信号及其监督蒸馏为少数几个诱导点。因此,NTK不再被迫在原始网格上表现为严格的线性回归器;相反,学习到的支持集本身变得非线性和任务自适应。在实验中,NTK-KIP在保持重建质量的同时实现了激进的压缩。例如,使用傅里叶位置编码时,我们以约20%的像素观测重建RGB Flowers图像,PSNR约为31dB;仅以约5%的像素观测时,PSNR约为20dB。使用原始位置编码时,我们在PSNR > 36dB时实现约80%的压缩,在PSNR > 23dB时约50%(参见图11)。因此,NTK-KIP解决了NTK的两个核心弱点:它通过学习的支持注入非线性,并通过将求解过程压缩到极小子集来降低核成本。

相似文章

分叉附近的状态空间NTK坍缩

arXiv cs.LG

本文发展了动力模型分叉附近梯度下降的局部理论,表明状态空间神经正切核坍缩为秩一算子,主导学习动力学,使优化有效低维且可从规范形式预测。

用于算子学习的神经均值与核校正

arXiv cs.LG

本文提出了一种结合神经网络均值与精确Matérn kernel校正的方法,用于偏微分方程中的算子学习,在结构力学和OCO-2辐射传输模拟等公开基准测试中达到了竞争性或改进的性能。

面向NV色心逆感知的神经场

arXiv cs.LG

本文提出了NeTMY,一种免摊销的坐标神经场,用于NV色心量子传感中的逆问题,通过使用校正的前向模型和稀疏重建损失来克服中心坍塌病理。