DepthBench:衡量残差连接如何实现更高的计算深度

Hugging Face Daily Papers 论文

摘要

本文介绍了 DepthBench,一个通过改变宽度-深度比率来研究 Transformer 中计算深度的可控基准。研究发现,像 HC 和 FullAttnRes 这样的残差连接设计是将架构深度转化为有效计算的关键。

深度是增加 Transformer 计算能力的自然方式,然而随着深度增长,更深层的贡献可能会减少。近期方法通过增强归一化(例如 LayerNorm Scaling)或残差连接(例如 mHC, AttnRes)来改善信息流动和深度利用。然而,尚不清楚这些方法是否真正将增加的架构深度转化为有效的计算深度,以及其报告的收益是源于更好的跨深度信息访问,还是未考虑的混杂因素。在本文中,我们引入了 DepthBench,一个用于研究不同架构计算深度的可控基准。我们系统性地改变宽度-深度比率(d_{model}/n_{layer}),从浅宽到深窄形状,同时保持模型大小和预训练方法固定。在 10 个代表性架构中,我们发现将更多容量分配给深度的收益强烈依赖于架构。标准的 Pre-LN 及其大多数基于归一化和缩放的变体在模型变得更深更窄时几乎无益,甚至可能降低性能,而 HC 和 Full AttnRes 即使在极端深形状下也能持续改进。这些收益不仅限于预训练损失,并持续转化为改进的领域特定性能和有效计算。受控的层级分析进一步表明,HC 和 Full AttnRes 的收益与更有效地利用额外层相关,揭示了跨架构计算深度的不同机制。总体而言,我们的研究结果将残差连接设计确定为深度是否能作为有意义的缩放轴的关键决定因素,因为它使额外的架构深度能够转化为有效计算。
查看原文
查看缓存全文

缓存时间: 2026/09/29 08:16

论文页面 - DepthBench:衡量残差连接如何实现更多计算深度

来源:https://huggingface.co/papers/2609.32534

摘要

深度是提升Transformer计算能力的自然方式,但随着深度增加,较深层的贡献可能会减弱。近期方法通过增强归一化(例如LayerNorm Scaling)或残差连接(例如mHC、AttnRes)来改善信息流动和深度利用。然而,这些方法是否真正将架构深度的增加转化为有效的计算深度尚不明确,其报告的性能提升究竟源于跨层信息访问能力的增强,还是未考量的混淆因素仍待厘清。本文提出DepthBench,一个用于研究不同架构计算深度的控制基准。我们在固定模型规模和预训练方案的前提下,系统调整宽度-深度比(d_model/n_layer),涵盖从浅宽到深窄的不同形态。通过对十种代表性架构的分析,我们发现将容量分配给深度的收益高度依赖架构类型。标准Pre-LN及其多数基于归一化与缩放的变体在模型变得更深更窄时收益甚微甚至性能下降,而HC与FullAttnRes即使在极端深度形态下也能持续提升性能。这些增益不仅体现在预训练损失上,还稳定转化为领域特定性能和有效计算能力的提升。受控的层级分析进一步表明,HC与FullAttnRes的优势与对新增层级的更有效利用相关,揭示了不同架构中计算深度的差异化机制。总之,我们的研究结果表明,残差连接设计是决定深度能否通过将额外架构深度转化为有效计算来充当有意义扩展轴的关键因素。

查看arXiv页面 (https://arxiv.org/abs/2609.32534) 查看PDF (https://arxiv.org/pdf/2609.32534) GitHub4 (https://github.com/keyu-wang-2002/DepthBench) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.32534)

通过代理获取论文: hf papers read 2609.32534 尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型关联此论文 在模型README.md中引用 arxiv.org/abs/2609.32534 以从此页面建立链接。

引用此论文的数据集0

暂无数据集关联此论文 在数据集README.md中引用 arxiv.org/abs/2609.32534 以从此页面建立链接。

引用此论文的Space0

暂无Space关联此论文 在Space README.md中引用 arxiv.org/abs/2609.32534 以从此页面建立链接。

包含此论文的收藏集0

暂无收藏集包含此论文 将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面建立链接。

相似文章

DeepLoop:循环Transformer的深度缩放

arXiv cs.LG

DeepLoop为循环Transformer引入了一种残差缩放方法,该方法根据参数访问进行调整,从而在物理块跨多轮重用时提高稳定性和性能。

残差神经网络中深度充分性的量化:一个一阶准则

arXiv cs.LG

本文定义了一个一阶准则,用于确定训练好的残差神经网络是否具有足够的深度,证明了插入候选处缺乏严格局部递减表征了深度饱和,并在ResNets、GPT-2风格模型和Pythia检查点上进行了经验验证。