标签
本文提出了一种跨深度的Transformer残差流几何分析方法,利用相对位移和正交普鲁克分析,揭示了六个指令调优模型在代码生成和翻译任务中的结构化规律。
介绍了多头注意力残差(MHAR),它将路由查询重塑为逐子空间头,使每个特征子空间通过自己的 softmax 读取深度历史。在基于 Nemotron 的语料库上从头训练,MHAR 在 100M 到 1B 规模上相比标准 Transformer 持续改善验证损失,并提升训练中期的下游准确率。
本文研究了长上下文检索中FFN残差写入的符号性质,发现FFN写入根据层和任务的不同起到抑制或放大作用,并提出了一种基于梯度的诊断方法来区分这两种角色。
本文介绍了xHC(扩展超连接),一种能够在Transformer中将残差流从原先的N=4限制有意义地扩展的方法,在18B和28B的MoE模型上取得了持续改进,且仅增加了适度的训练FLOPs。此外,还提出了xHC-Flash以减少内存流量,使得大型N残差流扩展在大语言模型预训练中变得实用。
讨论了Anthropic的一篇论文,该论文关于语言模型中形成全局工作空间的可言语化表示,并联系到微调小模型揭示的是性格而非能力的观点。
本文表明,前沿LLM能够在无内容的填充标记上进行多步推理,并且残差流中的隐藏状态可以被解码以高精度恢复中间值,挑战了思维链监控是唯一审计工具这一假设。
论文假设语言模型激活包含一个低秩密集分量,该分量被稀疏自编码器(SAEs)低效表示。通过添加一个线性瓶颈来吸收密集结构,作者减少了密集潜变量,并改进了在Gemma-2-2B上的稀疏探针性能。
一位独立研究者展示了证据,表明连贯的上下文可以在产生输出之前将LLM推入不同的内部状态,从而绕过表面安全过滤器。这表明当前的对齐方法(如RLHF)可能不是稳健的防御机制。
本文研究了 transformer 注意力机制中深层向量的值向量是否需要来自残差流的上下文。它提出了值银行(BoV),该方法在最后三分之一层中使用无上下文的、针对特定 token 的值向量,相比标准注意力机制,提高了验证损失和基准测试得分。
本文证明,LLMs可以在保持对齐输出的同时,在连贯上下文中进入可测量的不同内部潜在状态,揭示了当前仅监控表面token的对齐方法存在盲点。Gemma-3-12B-IT实验显示出强大的残差流几何偏移,现有安全框架无法检测,这对智能体AI部署具有重要影响。
本文研究了指令调优的LLM如何在残差流中结合角色和任务规范,发现在答案形成阶段,这种结合近似可加,使得替换时KL散度极小,但该可加机制并不能解释完整的多token生成过程。
本文对生产规模的大型语言模型进行了完整的 Jacobian 特征分解,揭示了从旋转主导的早期层到对称后期层的习得谱梯度,以及一个压缩扰动的低秩瓶颈。结果将扰动传播与压缩与网络功能拓扑联系起来。
本文从机制上解释了为什么LLMs在长时间的多轮交互中会丢失指令,引入了目标可访问性比率(GAR)指标和通道转换框架。通过消融研究和残差流探针,论文表明,对定义目标词元的注意力会在回合间关闭,而目标信息在残差表示中持续存在,并出现了架构特定的失败模式。
新预印本《Mathematics is All You Need 2》提出了“双通道定理”,证明 Transformer 残差流中的行为纤维在不同架构(从 Qwen 到 Llama)间具有符号稳定性且可因果操控。该研究声称具有高可复现性,并显示行为基底接近一维,从而将生成过程与潜在结构分离开来。
本文研究了大语言模型隐藏状态中线性可解码的失效信号是否可以通过残差流转向进行纠正。研究发现,虽然“过度思考”失效模式是可解码的,但由于其与任务关键计算的表示纠缠,固定的线性转向未能纠正这些失效,尽管探测探针有效地支持了选择性拒绝回答。
Arc Sentry 是一种全新的“生成前”提示注入检测器,直接读取模型内部残差流,在 130 条提示的基准上实现 92% 检出率、0% 误报;而 LLM Guard 仅 70% 检出率、3.3% 误报。
一篇介绍Three-Phase Transformer(3PT)的研究论文,该模型将特斯拉的多相几何应用于Transformer架构,将残差流组织成三个120°偏移的相位。该方法在WikiText-103上以极少的参数(0.00124%的开销)实现了7.2%的困惑度提升,以及1.93倍的收敛加速。