梯度忽视秩:Matrix-CODI 在 ProsQA 上的秩无关性
摘要
研究发现,matrix-CODI 模型中的秩截断不影响推理任务的准确率,表明秩可能与潜在表示中的并行推理路径无关。
arXiv:2609.03090v1 公告类型:新
摘要:连续思维链模型将推理压缩到潜在标记中。矩阵值变体通过 d x d 矩阵瓶颈路由每个潜在标记,引入秩作为潜在矩阵 Z 上的单样本结构可观测量。如果矩阵潜在通过叠加携带并行推理路径,秩应跟踪它们,而将 Z 截断为低秩应损害那些解决方案可能需要多个组件的任务的准确率。在 matrix-CODI 模型的四种训练机制中(三种在 ProsQA 上,一种在低于学习阈值的 GSM8K-Aug 上),rank-k 投影消融曲线在 0.6 个百分点内平坦。三种子重复实验产生 81.0 +/- 2.0 个百分点的准确率,而 Z 的最终有效秩跨度为 {4, 12, 13};损失函数不奖励任何特定的秩。为测试秩盲性是否仅源于展平后投影的读出,我们训练了四种读出:一种双线性重参数化,一种非线性于 Z 的双线性加 GELU 读出,一种通过 MLP 输入奇异值的 SVD 增强读出,以及一种在 Z Z^T 中的二次读出。所有四条 rank-k 曲线保持平坦(Spearman p 值分别为 0.63, 0.14, 0.82, 0.46)。平坦曲线在非线性于 Z 的读出中持续存在。线性探测器在 Z 上的表现低于原始预训练隐藏状态在目标预测上的表现(AUC 0.673 vs. 0.846)。在 vanilla GPT-2 SFT 上的负对照(无矩阵瓶颈,无 Z,三种子,n=500)在相同的干预范式下重现了平坦的 rank-k 曲线,池化平均范围为 0.20pp,并且随机 h 敏感性基线落在相同准确率上:仅 rank-k 消融将秩盲性与位置无关性混为一谈。
查看缓存全文
缓存时间: 2026/09/04 06:20
# 梯度不可见的秩:ProsQA上矩阵-CODI模型的秩不变性研究
来源:https://arxiv.org/abs/2609.03090
查看PDF (https://arxiv.org/pdf/2609.03090)
> 摘要:连续思维链模型将推理过程压缩至隐式标记中。矩阵值变体通过d×d矩阵瓶颈路由每个隐式标记,将秩作为潜矩阵Z的单样本结构可观测指标引入。若矩阵潜变量通过叠加机制承载并行推理路径,秩应能追踪这些路径;而将Z截断为低秩应在那些解决方案可能需要多重组件的任务中损害准确率。在矩阵-CODI模型的四种训练模式下(三种使用ProsQA,一种使用低于学习阈值的GSM8K-Aug),秩-k投影消融曲线在0.6个百分点内保持平坦。三次种子重复实验显示准确率为81.0 ± 2.0个百分点,而Z的最终有效秩范围为{4, 12, 13};损失函数并不奖励任何特定秩值。为检验秩盲现象是否仅源于先展平后投影的读出机制,我们训练了四种读出结构:双线性重参数化、Z非线性双线性+GELU读出、通过MLP处理奇异值的SVD增强读出,以及Z Z^T二次读出。所有四种秩-k曲线均保持平坦(Spearman p值分别为0.63、0.14、0.82、0.46)。Z非线性读出下平坦曲线依然持续。Z上的线性探测器在目标预测(AUC 0.673 vs. 0.846)中表现弱于原始预训练隐藏状态。在标准GPT-2 SFT(无矩阵瓶颈、无Z、三次种子、n=500)的负对照实验中,相同干预范式下的秩-k曲线同样呈现平坦特征,汇总均值范围仅0.20个百分点,且随机-h敏感性下限达到相同准确率:仅秩-k消融会混淆秩盲性与位置无关性。
## 提交历史
来自:Samuel Larsen [查看邮箱 (https://arxiv.org/show-email/cae88526/2609.03090)] **[v1]** 2026年9月2日 星期三 19:03:24 UTC(118 KB)相似文章
GRPO 下基于梯度的 LoRA 秩分配:一项实证研究
本研究通过实证表明,在监督微调中有效的基于梯度的 LoRA 秩分配,在基于 GRPO 的强化学习中会导致性能下降,原因在于梯度景观更为平缓以及存在梯度放大效应。
损失函数看不到基,但 Adam 能看到
本文研究了在因子化模型中,为什么 Adam 不表现出梯度下降所具有的隐式低秩偏差,并表明逐坐标预处理打破了相关对称性,而共享标量方法(如 Muon 和 Shampoo)则保持了这种对称性。
GRACE: 梯度对齐的推理数据筛选方法,实现高效后训练
GRACE提出了一种梯度对齐方法,对单个推理步骤进行评分,以选择对后训练最有价值的数据,仅用20%的数据就达到了全部数据性能的108.8%。
RankShift:数据库内分类偏移的检测与解释
RankShift是一种新型的数据库内方法,用于检测和解释数据流中的分类偏移,使用Pearson分数来识别责任类别,并在日志数据集上显示出与自动编码器相竞争的性能。
思考越多,偏见越大:推理模型中由长度驱动的位置偏见
本研究论文探讨了推理模型中的位置偏见,发现偏见并非随着“更多思考”而消除,而是与推理轨迹的长度成正比。该研究提供了因果证据,并提供了一套诊断工具包,用于审核多选问答评估中这种由长度驱动的偏见。