从通用到专有表示

Hugging Face Daily Papers 论文

摘要

本文为非参数化框架下从通用模型中提取任务相关表示建立了可辨识性保证,证明在稀疏正则化条件下,任务结构在不同时间步之间是可辨识的,且潜在表示在每个时间步内也是可辨识的。

给定一个通用模型,学习任务相关的专有表示对于下游应用至关重要。可辨识性——即渐近保证能够恢复真实表示——之所以关键,是因为它设定了任何模型的最终极限,即使拥有无限的数据和计算资源也无法超越。我们在完全非参数的设定下研究这一问题,不依赖干预、参数形式或结构约束。我们首先证明,即使序列缺乏严格的时间依赖且可能出现断连,任务分配可以遵循任意复杂和交错的结构,任务与时间步之间的结构也能在完全无监督的方式下被辨识。随后我们证明,在每个时间步内,仅通过简单的稀疏正则化,无需额外信息或参数约束,就能将任务相关的潜在表示与无关部分分离。这些结果共同奠定了一个分层基础:任务结构在不同时间步之间是可辨识的,而任务相关的潜在表示在每个时间步内也是可辨识的。据我们所知,每个结果都首次提供了通用的非参数可辨识性保证,它们的结合标志着向可证明地从通用模型转变为专有模型迈出了一步。
查看原文
查看缓存全文

缓存时间: 2026/05/14 20:20

论文页面 - 从通用表示到专用表示

来源:https://huggingface.co/papers/2605.12733

摘要

非参数可辨识性结果建立了在无需参数假设或干预的前提下,从通用模型中提取任务相关表示的基础保证。

给定一个通用模型( https://huggingface.co/papers?q=generalist%20model ),学习任务相关的专用表示( https://huggingface.co/papers?q=specialist%20representation )对下游应用至关重要。可辨识性( https://huggingface.co/papers?q=Identifiability )——即渐近地保证恢复真实表示——之所以关键,是因为它设定了任何模型(即使拥有无限数据和计算)的最终极限。我们在完全非参数设定( https://huggingface.co/papers?q=nonparametric%20setting )下研究这一问题,不依赖干预、参数形式或结构约束。我们首先证明,时间步与任务之间的结构在完全无监督的方式下是可辨识的,即使序列缺乏严格的时间依赖( https://huggingface.co/papers?q=temporal%20dependence )且可能断连,任务分配也可能遵循任意复杂且交错的结构。随后我们证明,在每个时间步内,任务相关的潜在表示( https://huggingface.co/papers?q=latent%20representation )可以在简单的稀疏正则化( https://huggingface.co/papers?q=sparsity%20regularization )下与无关部分解耦,无需任何额外信息或参数约束。综合起来,这些结果建立了一个层次化基础:任务结构在时间步之间是可辨识的,任务相关的潜在表示( https://huggingface.co/papers?q=latent%20representation )在每个时间内也是可辨识的。据我们所知,每个结果都提供了首个通用的非参数可辨识性( https://huggingface.co/papers?q=identifiability )保证,且合在一起标志着向可证明地从通用模型走向专用模型迈出了一步。

查看 arXiv 页面( https://arxiv.org/abs/2605.12733 )查看 PDF( https://arxiv.org/pdf/2605.12733 )添加到收藏( https://huggingface.co/login?next=%2Fpapers%2F2605.12733 )

在你的 agent 中获取这篇论文:

hf papers read 2605.12733

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.12733,即可从本页面链接。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.12733,即可从本页面链接。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.12733,即可从本页面链接。

包含此论文的收藏集 0

没有收藏集包含此论文

将这篇论文添加到一个收藏集( https://huggingface.co/new-collection )中,即可从本页面链接。

相似文章

从通用到专长表示

arXiv cs.LG

本文证明,在完全非参数设定下,无需干预或参数约束,即可从通用模型中识别出任务相关的潜在表示,实现了跨时间步和每一步内的层次化可识别性保证。

MoE专业化中的几何不对称性:功能去相关与表示重叠

arXiv cs.LG

本文提出一个Jacobian-PCA-Grassmann框架,用于分析混合专家(MoE)Transformer中专家专业化的几何结构。研究发现,专家表现出强烈的功能去相关,而其表示存在重叠,并且路由稀疏性显著影响这一几何结构。

无子空间可追踪:低秩训练中的不可辨识性与优化器状态

arXiv cs.LG

本文通过实验证明,在GaLore等低秩训练方法中,梯度的前r维子空间除了一个小的可复现核心外是不可辨识的,估计器噪声主导了表观旋转。文章分析了这对优化器状态传输的影响,并引入了LDAdam,它在困惑度上优于GaLore。

循环权重空间中的任务受限对称性

arXiv cs.LG

本文通过使用有序实Schur坐标来识别保持任务性能的结构消融,研究循环神经网络中的功能冗余,发现任务受限对称性在不同任务和训练方案之间存在差异。