GeoPair: 保持几何结构的跨层分解用于免训练Transformer压缩

Hugging Face Daily Papers 论文

摘要

本文介绍了GeoPair,一个用于Transformer压缩的免训练框架,它在保持激活几何结构的同时优化跨层分解,实现了跨多样架构的最新结果。

Transformer架构表现出跨层冗余性,但后训练压缩管道通常独立优化各层或依赖忽略层特定激活几何的启发式分组策略。我们引入了一个有原则的免训练框架,该框架顺序优化跨层权重配对和共享字典分解。我们方法不是强制相邻层的权重共享基础或启发式地合并激活统计,而是识别结构上兼容的投影并学习一个共享表示,以更好地保留每层的独特校准几何结构。结合结构化稀疏性,这在不牺牲功能保真度的情况下产生了高度高效的权重分解。在跨多样架构、规模和模态方面,我们的方法实现了最新结果,持续优于独立的结构化权重分解和基于启发式分组策略的替代配对权重分解。通过用收敛的、优化驱动的管道替代启发式工程策略,我们为跨不同模态的可扩展Transformer压缩奠定了理论基础。
查看原文
查看缓存全文

缓存时间: 2026/09/24 11:39

论文页面 - GeoPair:免训练Transformer压缩的几何保持跨层分解

来源:https://huggingface.co/papers/2609.25963

摘要

Transformer架构存在跨层冗余,但训练后压缩管道通常以孤立方式优化各层,或依赖忽略层特定激活几何特性的启发式分组策略。我们引入一种基于原理的免训练框架,可序列化地优化跨层权重配对与共享字典分解。与强制相邻层权重共享基础基或启发式合并激活统计量不同,我们的方法能识别结构兼容的投影,并学习更好地保留每层独特校准几何的共享表示。结合结构化稀疏性,该方法可在不牺牲功能保真度的情况下实现高效的权重分解。在多种架构、规模和模态上,我们的方法均取得最优效果,持续优于采用启发式分组策略的独立结构化权重分解及其他成对权重分解方法。通过用收敛的优化驱动管道替代启发式工程策略,我们为跨模态可扩展的Transformer压缩建立了理论基础。

查看arXiv页面 (https://arxiv.org/abs/2609.25963) 查看PDF (https://arxiv.org/pdf/2609.25963) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.25963)

通过代理获取此论文: hf papers read 2609\.25963

未安装最新CLI?请运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2609.25963可从此页面建立链接。

引用此论文的数据集 0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2609.25963可从此页面建立链接。

引用此论文的Spaces 0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2609.25963可从此页面建立链接。

包含此论文的收藏集 0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection)可从此页面建立链接。

相似文章

基于Frames的Transformer模型微调

arXiv cs.AI

本文提出FrameFT,一种参数高效的微调方法,使用Fusion Frame基中的稀疏系数,在减少内存占用的同时,达到或超过最先进的PEFT技术的性能。