FairCompressAgent: 一个用于FPGA部署的公平感知模型压缩智能体框架
摘要
本文提出了FairCompressAgent,一个智能体框架,它使用语言模型规划器来优化用于FPGA部署的公平感知模型压缩,平衡准确性、公平性和效率。
查看缓存全文
缓存时间: 2026/09/17 09:24
# FairCompressAgent:面向公平感知的模型压缩智能体框架,用于FPGA部署
来源:https://arxiv.org/html/2609.17786
郭远博 | 单位:圣母大学计算机科学与工程系,美国圣母市 | yguo6@nd\.edu
石宜豫 | 单位:圣母大学计算机科学与工程系,美国圣母市 | yshi4@nd\.edu
###### 摘要
公平感知模型压缩需要选择能够平衡准确性、公平性和部署成本的方法与配置。当压缩方法组合使用或用户需求发生变化时,这些决策变得更加困难。本文提出FairCompressAgent(FCA),一个智能体框架,通过统一的算子接口集成公平感知剪枝、增量量化和稀疏低秩分解。语言模型规划器利用模型配置文件和测量结果选择压缩配置,而执行层则执行压缩、微调、评估和基于约束的选择。FCA还支持需求更新,并在请求无法满足时报告剩余的违规情况。在Fitzpatrick-17k数据集上使用VGG-11模型的实验中,比较了四种搜索方法在40个测量配置上的表现。在准确性约束请求下,FCA选择的压缩模型推理张量存储减少了59.54%,同时验证集平均精度从0.5141提升至0.5233,均等机会(EOpp)从0.2251降至0.2168。在各自的终止策略下,FCA平均需要7.33次候选评估即可达到与一次性规划相同的最终选择,而后者需要12次评估。重复微调、留出测试和在线需求更新体现了该压缩工作流的稳定性和交互性。结果表明,测量反馈和显式约束如何支持公平感知压缩配置的选择和交互式优化。
###### 关键词:
深度学习、公平性、硬件效率、AI智能体、FPGA。
## I 引言
随着深度学习(DL)在日常生活中各个领域的应用日益广泛,其应用引发了一系列需要解决的问题。其中,公平性和效率通常被视为独立的问题。首先,公平性问题源于预测结果中的歧视,例如就业歧视[1 (https://arxiv.org/html/2609.17786#bib.bib10),2 (https://arxiv.org/html/2609.17786#bib.bib11)],以及预测质量的差异,例如医疗不平等[2 (https://arxiv.org/html/2609.17786#bib.bib11),3 (https://arxiv.org/html/2609.17786#bib.bib12)]。深度学习模型会影响人们的决策,因此由不公平模型支持的应用可能会助长系统性歧视,使特定人群处于不利地位。为了解决公平性问题,先前的工作主要集中在算法优化[4 (https://arxiv.org/html/2609.17786#bib.bib29),5 (https://arxiv.org/html/2609.17786#bib.bib30),6 (https://arxiv.org/html/2609.17786#bib.bib34)]。与此同时,模型压缩是在有限硬件资源下本地部署深度学习模型最有用的方法之一[7 (https://arxiv.org/html/2609.17786#bib.bib23)],包括FPGA平台。例如,剪枝[8 (https://arxiv.org/html/2609.17786#bib.bib13),9 (https://arxiv.org/html/2609.17786#bib.bib14)]和量化[10 (https://arxiv.org/html/2609.17786#bib.bib15),11 (https://arxiv.org/html/2609.17786#bib.bib16)]是两种广泛使用的模型压缩技术。然而,传统上,压缩决策主要平衡预测质量和计算成本,并未明确考虑不同人口群体之间的性能差异。[12 (https://arxiv.org/html/2609.17786#bib.bib24)]也指出,即使准确性变化很小,模型压缩也可能不成比例地影响偏差。
除此之外,FPGA部署与模型压缩特别相关。可用的计算资源和内存带宽共同约束加速器设计,而片上存储影响数据复用和传输到外部内存[13 (https://arxiv.org/html/2609.17786#bib.bib21)]。低精度设计进一步将数值表示与并行性和数据流联系起来[14 (https://arxiv.org/html/2609.17786#bib.bib22)]。不同的压缩方法以不同的方式应对这些约束。例如,剪枝改变神经元的连接性,而量化限制权重的表示方式。由此产生的表示决定了目标设计可以利用哪些存储和执行机会。因此,选择合适的压缩配置需要同时考虑算子兼容性、资源需求以及推理性能(在准确性和公平性方面)[15 (https://arxiv.org/html/2609.17786#bib.bib28)]。
近期研究开始探索深度学习模型公平性与硬件平台之间的关系[16 (https://arxiv.org/html/2609.17786#bib.bib31),17 (https://arxiv.org/html/2609.17786#bib.bib32),18 (https://arxiv.org/html/2609.17786#bib.bib35),19 (https://arxiv.org/html/2609.17786#bib.bib36)]。具体而言,公平感知压缩方法已被引入,旨在压缩过程中寻求公平性改进,在准确性、公平性和效率之间创造权衡。FairPrune[20 (https://arxiv.org/html/2609.17786#bib.bib1)]通过组敏感剪枝解决此问题,而FairQuantize[21 (https://arxiv.org/html/2609.17786#bib.bib2)]将这一思想扩展到增量权重量化。此外,稀疏低秩分解提供了另一种降低模型复杂性的方法[22 (https://arxiv.org/html/2609.17786#bib.bib3)],FairLRF则将其调整为组敏感压缩[23 (https://arxiv.org/html/2609.17786#bib.bib17)]。还有一些工作沿着这些路径进行了探索[24 (https://arxiv.org/html/2609.17786#bib.bib33)]。虽然所有这些方法都提供了通过压缩解决公平性的不同方式,但在它们之间进行选择仍然需要对压缩强度、微调、层覆盖范围和方法顺序做出决策。
联合压缩搜索和语言模型辅助优化为协调这些决策提供了基础。APQ联合搜索架构、剪枝和量化策略[25 (https://arxiv.org/html/2609.17786#bib.bib6)],而LLAMBO则在贝叶斯优化中研究语言模型[26 (https://arxiv.org/html/2609.17786#bib.bib7)]。FairAgent使用语言模型智能体支持公平感知机器学习[27 (https://arxiv.org/html/2609.17786#bib.bib8)],ProfilingAgent使用性能分析结果指导模型优化[28 (https://arxiv.org/html/2609.17786#bib.bib9)]。将这些思想应用于公平感知压缩需要为兼容算子提供通用接口,并为评估准确性、公平性和效率提供明确的标准。
为了将这些能力整合到综合工作流中,我们提出了FairCompressAgent(FCA),一个智能体框架,用于在用户定义的需求下选择和组合公平感知压缩算子。FCA使用模型配置文件和评估结果指导压缩选择,并允许用户在搜索过程中修改需求。图1 (https://arxiv.org/html/2609.17786#S1.F1)总结了用户与FCA之间的交互过程。
指定模型、标注数据和需求(准确性、公平性、存储和搜索预算)
FCA评估压缩配置
根据需求比较测量的权衡
检查所选模型并报告
审查性能、资源使用和未满足的约束
接受结果或修改需求
使用累积观察结果继续进行
图1:用户与FCA的交互。用户提供任务和需求,检查测量结果,并可以修改约束以利用累积的评估记录继续进行。
本文的主要贡献如下:
- •我们将公平感知压缩表述为受约束的配置选择问题,并通过共同的扰动视图和可执行接口组织剪枝、量化和稀疏低秩分解。
- •我们开发了一种用于自适应压缩规划的智能体架构,具有显式约束检查和对需求更新的支持。
- •我们使用40个测量配置、四种搜索方法、重复微调、留出测试和在线执行评估了该框架。在准确性约束请求下,FCA选择了一个推理张量存储减少59.54%的模型,并在更严格的公平性请求下识别了未满足的约束。
FairCompressAgent的源代码可在以下地址获取:https://github.com/guoyb17/FairCompressAgent。
## II 问题表述
### II-A 输入与准确性指标
考虑一个分类数据集$\mathcal{D}=\{(x_{i},y_{i},a_{i})\}_{i=1}^{N}$,其中$x_{i}$是输入,$y_{i}$是类别标签,$a_{i}$是敏感属性。我们关注二元敏感属性,它将标注样本划分为群体$g\in\\{0,1\\}$。给定一个预训练模型$f(\theta_{0})$,我们的目标是找到一个满足用户对准确性、公平性和效率要求的压缩模型。
遵循FairPrune、FairQuantize和FairLRF的方法,我们使用平均精度作为准确性性能的主要度量。它是两个人口群体的宏精度值的平均值。对于固定数量的$K$类别,其定义为
$P_{g}=\frac{1}{K}\sum_{k=1}^{K}\operatorname{Prec}_{g,k},\qquad P_{\mathrm{avg}}=\frac{P_{0}+P_{1}}{2},$
(1)
其中$\operatorname{Prec}_{g,k}$是群体$g$中类别$k$的“一对多”精度。当该群体中没有样本被预测为类别$k$时,精度设为零。
### II-B 公平性与效率指标
均等机会和均等赔率[29 (https://arxiv.org/html/2609.17786#bib.bib4)]在先前关于公平性的研究中被广泛使用。对于均等机会,它是目标属性每个类别内不同人口群体的真负率(记为EOpp0)或真正率(记为EOpp1)的差值之和。对于均等赔率(记为EOdd),它收集真正率差异加上假阳性率差异之和。这些指标可以通过以下公式计算:
EOpp0=∑k=1K|TNRk1−TNRk0|,EOpp0=\\sum_{k=1}^{K}{\\lvert TNR_{k}^{1}\\-TNR_{k}^{0}\\rvert},(2)
EOpp1=∑k=1K|TPRk1−TPRk0|,EOpp1=\\sum_{k=1}^{K}{\\lvert TPR_{k}^{1}\\-TPR_{k}^{0}\\rvert},(3)
EOdd=∑k=1K|TPRk1−TPRk0+FPRk1−FPRk0|.EOdd=\\sum_{k=1}^{K}{\\lvert TPR_{k}^{1}\\-TPR_{k}^{0}\\+FPR_{k}^{1}\\-FPR_{k}^{0}\\rvert}\\.(4)
对于EOpp0、EOpp1和EOdd,数值越小越好。
这些指标从不同角度反映了模型性能在不同人口群体上的统计差异。鉴于在疾病诊断等现实场景中,正例的公平性通常更为重要,我们在本文中使用EOpp1作为公平性指标的代表,下文简称EOpp。
压缩模型表示为$z=(\theta,\rho)$,其中$\rho$指定其可执行形式,包括分解层和约束权重。我们测量存储$S(\rho)$为推理参数和缓冲区张量占用的字节数,不包括优化器状态、训练掩码和文件头。因此,存储测量反映了用于推理的表示。执行成本还取决于表示如何映射到目标架构。当前实验使用稠密FP32张量,包括低秩层的因子。
### II-C 受约束的配置选择
一个配置$\pi=((o_{1},\eta_{1}),\ldots,(o_{T},\eta_{T}))$指定了压缩算子$o_{t}$、它们的顺序和设置$\eta_{t}$。每个配置从提供的基线开始,生成一个候选$z_{\pi}$。三个目标是更高的$P_{\mathrm{avg}}$、更低的EOpp和更小的存储:
$\min_{\pi}\bigl(\-P_{\mathrm{avg}}(z_{\pi}),\ \mathrm{EOpp}(z_{\pi}),\ S(\rho_{\pi})\bigr).$(5)
用户指定可接受的平均精度损失$\epsilon_{P}$、EOpp上界$d_{\max}$,以及可选的存储比上界$s_{\max}$:
$P_{\mathrm{avg}}(z_{\pi})\geq P_{\mathrm{avg}}(z_{0})-\epsilon_{P},$(6)
$\mathrm{EOpp}(z_{\pi})\leq d_{\max},$(7)
$S(\rho_{\pi})/S(\rho_{0})\leq s_{\max}.$(8)
在可行的观察结果中,实验首先选择最小存储,然后是最大$P_{\mathrm{avg}}$,然后是最小EOpp,最后使用候选标识符打破任何剩余的平局。
## III 公平感知压缩算子
### III-A 通用的组敏感评分
不同的权重对不同人口群体的预测性能贡献不均等,二阶敏感性为权重扰动排名提供了有前景的基础[30 (https://arxiv.org/html/2609.17786#bib.bib25)]。FairPrune和FairQuantize利用这一观察来决定要修改哪些权重,而FairLRF则将相关的评分应用于低秩因子[20 (https://arxiv.org/html/2609.17786#bib.bib1),21 (https://arxiv.org/html/2609.17786#bib.bib2),23 (https://arxiv.org/html/2609.17786#bib.bib17)]。我们通过通用的评分和评估接口将这些现有方法组织为压缩算子。
令$L_{g}(\theta)$为群体$g$在固定评分子集上的平均损失。对于权重扰动$\Delta$,泰勒展开给出
$L_{g}(\theta+\Delta)\-L_{g}(\theta)=\nabla L_{g}^{\top}\Delta\+\tfrac{1}{2}\Delta^{\top}H_{g}\Delta\+R_{g}(\Delta),$(9)
其中$H_{g}$是组特定的海森矩阵,$R_{g}(\Delta)$包含高阶项。算子使用以下对角二次评分:
$s_{i}=\tfrac{1}{2}\Delta_{i}^{2}\left(h_{u,i}\-\beta h_{p,i}\right),\qquad\beta\geq 0,$(10)
这里$h_{g,i}$是$H_{g}$的第$i$个对角线元素,$u$和$p$分别是参考的表现较差和表现较好的群体。在整个搜索过程中,实验将这些角色固定为基线比较中的“浅肤色”和“深肤色”。较小的评分有利于相对于群体$p$对群体$u$的估计损失影响较小的更改。超参数$\beta$调整局部排序,而(7 (https://arxiv.org/html/2609.17786#S2.E7))控制所得模型的测量公平性。
局部评分对提议的修改进行排名。微调后的全面评估决定所得模型是否满足用户需求。
### III-B 剪枝与增量量化
对于FairPrune,移除一个权重将其设为零,在公式(10 (https://arxiv.org/html/2609.17786#S3.E10))中给出$\Delta_{i}=\-\theta_{i}$[20 (https://arxiv.org/html/2609.17786#bib.bib1)]。该算子在每个目标张量内选择所需数量的最低得分合格权重。累积掩码在随后的微调中将这些权重保持为零。相似文章
AgentFAIR:面向地理空间数据集FAIR原则评估的多智能体协作框架
AgentFAIR是一个多智能体框架,利用LLM评估器和批评者来评估地理空间数据集的FAIR合规性,在专家研究中实现了89%的子原则一致性和Fleiss κ=0.71,每个数据集成本为0.054美元。
Federated Foundation Models Fine-Tuning with Heterogeneous Compressed Clients
This paper proposes FedSLM, a parameter-centric framework for federated fine-tuning of foundation models with heterogeneous compressed clients, using SVD-based decomposition and a weak-to-strong elicitation step to handle resource asymmetry. Experiments show it outperforms existing federated baselines while reducing client GPU memory by ~50%.
FlexComp: 用于上下文中每种压缩比率的单一模型
FlexComp 是一个与方法无关的框架,它将压缩比率与训练和部署解耦,使得单一模型能够使用 Matryoshka 风格训练和基于每个输入的预算选择,在任何比率下压缩 LLM 上下文,以实现高效推理。
AgentCompass: 统一智能体能力评估基础设施
AgentCompass 是一个面向基于大语言模型的智能体的开源、轻量级且可扩展的评估基础设施,将基准测试、测试框架与运行环境解耦,支持灵活配置。它覆盖五个能力维度共20多个基准测试,并提供容错运行时与轨迹分析工具。
双智能体LLM中继中的状态压缩:约束保持的封闭世界研究
本文评估了双智能体LLM中继中用于旅行规划的交接压缩,比较了JSON提取和叙述摘要等方法,发现结构化表示能更好地保持约束。