水平扩展LLM:无需权重修改的隐藏状态耦合 [R]
摘要
残差耦合(RC)使用轻量级学习线性桥接器并行连接冻结的语言模型,实现无需权重修改的水平扩展。与MoE相比,它最多可将困惑度降低80.7%,并在TruthfulQA上提升9.1个百分点的准确率。
残差耦合(RC)使用小型、可学习的线性桥接投影并行连接冻结的语言模型。这些桥接器从一个模型读取隐藏状态,并在中间层向另一个模型的残差流注入加法更新。在双向设置中,同时返回的桥接器形成一个反馈循环,稳定两个流而不改变基础权重。该架构建立了一个两步范式,其中基础模型充当记忆器,而轻量级线性桥接器处理跨领域泛化。将桥接器限制为纯线性映射可防止过拟合,因为它们只能映射冻结表示空间之间的现有几何关系。由于桥接器是针对真实目标数据进行优化的,它们没有动机去映射无根据的特征,例如单个模型的幻觉。保持基础权重完全冻结可以消除灾难性遗忘。系统保持操作封闭性,通过其现有结构转换输入,而不是改变自身以适应输入。
在相同的冻结模型上评估双向RC与混合专家(MoE)路由,结果显示:
* 医疗(3模型):将困惑度降至11.02,而MoE为56.80,冻结基线为57.08。这代表了80.7%的降低。
* TruthfulQA健康(MC1):准确率较基线提升9.1个百分点。独立模型的幻觉不相关,使得桥接门控能够放大一致性的跨模型更新,同时抑制个体错误。
* 编码测试:CodeGPT-small-py和GPT-2使用不同的分词器,导致不匹配文本上的基线困惑度为700万。MoE达到878,但RC通过读取输出投影崩溃前的隐藏状态实现了5.91。
该框架为多模型系统引入了水平扩展轴,超越了通过更大的单体模型进行垂直扩展的方式。延迟仍受限于最慢的单个模型。可以添加或移除专家模型而无需重新训练剩余系统。在某些场景中,该架构可以用单次并行前向传递取代代理工作流中的多轮文本提示,允许模型和/或桥接器在独立节点或边缘设备上运行,而无需中央瓶颈。通过将记忆化与关系对齐解耦,RC桥接器为扩展多模型系统提供了框架,并开辟了原生多模态集成的路径。
论文:[https://ssrn.com/abstract=6746521](https://ssrn.com/abstract=6746521) 代码:[https://github.com/pfekin/residual-coupling/](https://github.com/pfekin/residual-coupling/)
相似文章
大规模下的Hidden Decoding: 大型语言模型的潜在计算扩展
本文介绍了Hidden Decoding,这是一种针对LLM的序列长度扩展方法,通过将每个令牌扩展为多个具有独立嵌入表的流,并在每个令牌内增加内部计算,同时使用Stream-Factorized Attention来保持低成本。在多达617B参数的模型上的实验显示,该方法较基线有一致的改进,展示了一条实用的固定骨干扩展路径。
$R^2$-dLLM:通过时空冗余削减加速扩散大语言模型
R²-dLLM 引入时空冗余削减技术,在保持生成质量的同时将扩散 LLM 的解码步数最多压缩 75%,直击部署瓶颈。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。
学习,快与慢:走向持续适应的LLMs
一种针对LLMs的快慢学习框架,将固定的慢权重与优化的快上下文权重相结合,在持续学习场景中实现了高达3倍的样本效率提升,并减少了灾难性遗忘。
自信扩展:针对自适应测试时间缩放的LLM置信度校准
本文提出了C3RL,一种在保持准确性的同时校准LLM置信度的强化学习算法,以及CAS,一种基于置信度的自适应测试时缩放策略,可将推理成本降低多达12.33倍。