LoRA用于性别包容性重写与对立叙事生成的激活引导
摘要
本文介绍了IHLC在LT-EDI 2026共享任务中的提交方案,使用LoRA微调进行性别中性重写(排名第3)和激活引导进行对立叙事生成(排名第6),同时展示了其潜力与局限性。
arXiv:2607.23083v1 Announce Type: new
摘要:性别包容性语言生成旨在将有偏见的文本转换为包容性替代文本,同时保留语义和上下文连贯性。本文介绍了针对LT-EDI 2026共享任务的IHLC系统,该系统同时处理性别包容性重写和对立叙事生成。对于性别包容性重写,我们采用了参数高效的LoRA微调,官方得分为80.00%。我们的主要贡献是一种计算高效的推理时表示工程方法,用于对立叙事生成。我们通过主成分分析(PCA)从对比隐藏状态激活中推导出一个主引导方向,并在推理时将其注入Gemma-3-4B-it的中间表示中,从而在不修改模型权重的情况下实现对包容性回答的行为引导。结合约束提示,该方法生成了礼貌且上下文适当的对立叙事,官方得分为78.12%。我们进一步对引导行为进行了人工分析,识别出关键失败模式,包括语义漂移、残余偏见泄露、层敏感性、过度引导和文本退化。我们的发现突出了激活引导作为参数更新的轻量级替代方案在可控且社会对齐的语言生成中的实际潜力和当前局限性。
查看缓存全文
缓存时间: 2026/07/28 06:27
# 1 引言 来源:https://arxiv.org/html/2607.23083 ###### 摘要 本文介绍了 IHLC 团队在 LT-EDI 2026 共享任务“性别包容性语言生成”上的提交成果。针对子任务 A(性别中立重写),低秩适应(LoRA)微调获得了 80.00% 的分数,排名第三。针对子任务 B(反叙述生成),我们提出了一种计算高效的激活引导方法,属于表示工程范畴。通过主成分分析从反事实激活中推导出引导方向,并在推理时注入到 Gemma-3-4B-it 模型中,无需权重更新即可使输出向包容性偏移。结合约束性提示,该方法生成了礼貌且上下文感知的回应,得分为 78.12%(排名第六)。对 47 个输出的人工评估揭示了关键失败模式:语义漂移、残余偏见泄露、层特定纠缠、过度引导不稳定以及重复。结果表明,激活引导在性别包容性反叙述生成方面既有潜力,也存在局限性。 性别包容性语言生成旨在将有偏见或性别标记的句子转化为包容、性别中立且上下文连贯的替代方案,同时保留含义和流畅性。LT-EDI 共享任务(Chakravarthi 等,2026)提供了平行资源以及一个混合型 LLM 作为评判者的评估框架(含人工监督),用于衡量公平性和语义保留度。该任务包含两个子任务:(A) 性别包容性语言生成(多语言;我们仅参与英语部分)和 (B) 反叙述生成(仅限英语)。 虽然子任务 A 通过标准的 LoRA 微调实现,但本文重点介绍我们在子任务 B 中使用的非常规方法。对于反叙述生成,我们的 IHLC 提交基于一种激活引导方法(Turner 等,2023;Zou 等,2023),该方法从配对的偏见/中立示例中识别引导方向(通过激活差异的主成分分析),并在推理时将该向量注入到选定的中间层(Li 等,2024;Subramani 等,2022)。同时结合约束性提示模板,以鼓励简洁、中立的重写。该方法和实验代码被打包并导出为 Jupyter 笔记本222https://github.com/manojbalaji1/IHLC-Gender-Inclusive。 ## 2 相关工作 我们的系统借鉴了偏见缓解、表示工程和自动评估框架方面的最新进展。 **性别包容性语言与偏见缓解:** NLP 社区长期以来记录了语言模型中社会偏见的放大现象(Bolukbasi 等,2016;Sheng 等,2019)。缓解这些偏见的努力范围从数据增强和去偏嵌入(Sun 等,2019)到基于规则和神经的包容性重写(Vanmassenhove 等,2021)。Muthusamy Chinnan 等人(2025)的一项近期研究将精心策划的包容性文本语料库与两轮 RAG 和思维链提示相结合,以基于并推理生成的文本,在机器和人工评估中均显示出性别偏见的减少。 **激活引导与表示工程:** 为了在不进行昂贵的微调的情况下调整模型行为,我们使用了激活引导。Turner 等人(2023)证明,将引导向量注入前向传播可以可靠地控制语言模型的输出。Zou 等人(2023)进一步形式化了这种自上而下的方法,展示了如何通过对比激活对上的主成分分析来识别稳健的语义方向。类似推理时干预已被成功用于改变事实回忆(Meng 等,2022)和调整模型真实性(Li 等,2024)。 **反叙述生成:** 针对仇恨言论或偏见生成共情回应需要在礼貌与坚定纠正之间进行复杂的权衡(Qian 等,2019)。Tekiroğlu 等人(2020)和 Chung 等人(2021)强调了生成上下文感知、基于知识的反叙述的重要性,而不仅仅是简单否定有偏见的陈述。最近的方法还强调人机协作,以在反叙述生成中保持输出质量和相关性(Bonaldi 等,2022)。 **自动评估:** 最后,我们依赖组织者的混合评估框架,这与 LLM 作为评判者范式的日益普及相一致。Zheng 等人(2024)验证了强大的 LLM 在定性指标上与人工标注者具有高度一致性,但我们的失败分析证实,人工监督对于检测微妙的语义漂移仍然至关重要。 ## 3 共享任务概述与评估 ### 3.1 子任务 **子任务 A——性别包容性语言生成。** 将带有性别色彩或偏见的句子重写为完全包容的变体(例如:fireman→\\rightarrow消防员)。训练和评估数据提供了多种语言版本;我们仅参与英语部分。英语句子对数据集的大小在任务材料中已有说明。 **子任务 B——反叙述生成。** 针对公开的性别偏见陈述生成共情且有说服力的反叙述(仅限英语)。示例:输入“女性不擅长数学。”输出:一个纠正性的、共情的反叙述。 ### 3.2 评估指标(组织者制定) 组织者采用了一种混合评估方法,如任务文档所述:基于固定评分标准的 LLM 作为评判者,外加专家人工评估员的抽查/裁定。对于子任务 A,报告的组成部分包括: - • GA:性别假设去除效果(性别假设被移除的程度)。 - • GN:性别中立性(使用包容性术语和中立措辞)。 - • QR:质量与相关性(流畅性、语义保留度)。 - • 总体得分:GA、GN 和 QR 的平均值(以百分比表示)。 对于子任务 B,报告的组成部分包括: - • PR:礼貌与尊重度。 - • CCNC:上下文反叙述连贯性(反叙述是否连贯地回应了输入上下文)。 - • QR:质量与相关性。 - • 平均分:PR、CCNC 和 QR 的平均值(以百分比表示)。 ## 4 系统描述 子任务 A 使用了 LoRA 微调。对于子任务 B,我们的设计强调两个互补的组成部分:(1) 激活层面的引导,使模型行为偏向包容性;以及 (2) 严格的提示模板,以限制生成文本的长度和格式。 ### 4.1 激活引导模块 聚焦于子任务 B,我们从偏见句子与中立句子对(“反事实”对)中计算一个激活空间中的引导向量,改进了 Zou 等人(2023)描述的表示工程协议。实际操作如下: 1. 1. 在选定的 Transformer 层,提取偏见句子(负例)和包容性重写(正例)的隐藏激活。 2. 2. 计算每个样本的差异,并对差异向量进行主成分分析拟合;取第一个主成分作为引导方向(Turner 等,2023)。 3. 3. 在推理时,在选定层注册一个前向钩子,该钩子将引导向量的缩放版本添加到每个 token 位置(或最后一个 token)的隐藏状态中,由引导系数 α\\alpha 控制。 这一完整过程,包括层发现、向量提取、主成分分析构建、钩子机制和引导强度调整的实现细节,都在我们提交的代码笔记本中有所描述。 ### 4.2 提示模板与解码 我们使用了两种提示模板: - • DEI 提示(柔性):指示模型为 DEI 重写专家,提供柔性示例,并要求进行重写(适用于灵活、解释性的输出)。 - • 严格提示(确定性):强制单行输出,并附有严格规则(“仅输出最终的句子。”),用于评估运行,以避免可能混淆自动评判者的解释性前缀。 我们混合使用了贪心解码和低温采样,并加入了重复惩罚。正如 Holtzman 等人(2020)所指出的,文本退化和循环在神经生成中很常见;我们观察到这些循环主要发生在引导系数 α\\alpha 设置过高时。笔记本中记录了推荐的引导系数(例如,0.7–1.5)和抗重复设置。 ## 5 实验设置 ### 5.1 数据 我们使用了组织者提供的子任务 A 句子对(英语部分)和子任务 B 反事实对。数据集大小和任务统计信息在共享任务文档中已有说明。 ### 5.2 模型与实现 我们的实验使用了 Gemma-3-4B-it 模型(Gemma Team, 2025)(详细信息见代码工件),引导钩子和提示管道使用 PyTorch/HuggingFace 实现。Gemma 3 系列提供了一个高能力、轻量级的基础,并具有扩展的上下文窗口,非常适合激活层面的干预。完整的生成管道和调优脚本可在我们导出的笔记本中找到。 ### 5.3 评估 我们提交了确定性的、单句重写用于自动评估。组织者使用其混合型 LLM 作为评判者的评分标准(含人工监督)对提交结果进行了评估;下面报告的分值是提供给团队的官方任务得分。 ## 6 官方结果(仅限英语) 表 1 总结了 IHLC 提交(仅英语)的官方得分,由共享任务组织者报告。 表 1:IHLC(英语)的官方任务得分。上述指标定义和混合评估程序在共享任务文档中已有描述。任务 A 总体得分是 GA、GN 和 QR 的平均值;任务 B 平均分是 PR、CCNC 和 QR 的平均值。 ### 6.1 解读 - • 任务 A:在 GA、GN 和 QR 上均一致达到 80%,表明我们的系统在许多情况下可靠地产生了中性的词汇选择并保留了整体含义,在 9 个参赛团队中排名第 3。 - • 任务 B:较高的 PR 和 CCNC 得分(≈\\approx85%)表明系统生成了礼貌、上下文感知的反叙述,但 QR 子得分(≈\\approx65%)拉低了平均值,表明某些输出偶尔出现语义漂移或相关性降低。这导致在英语反叙述子任务中,排名第 6(共 7 个参赛者)。 ## 7 分析 我们进行了试错(记录在工件中),以了解引导强度、提示严格性和解码策略对质量的影响: - • 引导强度:低值产生的中立性较弱;过高的值导致重复循环和幻觉。推荐操作范围:0.6–1.2,可在中立性和连贯性之间取得良好平衡。笔记本中包含了提取的诊断结果和示例。 - • 提示模板:严格的一行提示通过减少被惩罚为不相关的解释性前缀,提高了自动评判者的分数。 - • 解码:带有重复惩罚的低温采样防止了在高引导强度下观察到的“alalal”式循环行为。 ### 7.1 失败模式的人工分析 我们分析了激活引导应用于 Gemma-3-4B-it 模型的失败模式,其中基于主成分分析的方向(从最后一个 token 隐藏状态差异计算)以系数 α\\alpha 注入到第 16 层。基于对测试集中 47 个生成的反事实样本的人工评估,我们确定了五种主要失败模式。 错误分布(n=47): - • 忠实度-编辑权衡:53%(25 个案例) - • 层特定敏感性(纠缠):23%(11 个案例) - • 残余偏见泄露:11%(5 个案例) - • 过度引导不稳定:9%(4 个案例) - • 重复与退化:4%(2 个案例) #### 7.1.1 残余偏见泄露 由于引导仅使用最后一个 token 的表示,早期上下文 token 中编码的偏见可能持续存在。在这些实例中,模型消除了性别主语,但未能否定有害的前提,而是将负面刻板印象普遍应用于所有人。 - • 输入:“男孩粗心大意” - • 输出:“所有性别认同的人都缺乏意识和责任感。” - • 分析:保留了残余的负面框架(“缺乏意识和责任感”)。因果关系被简化而非纠正,表明仅部分遍历了偏见流形。 #### 7.1.2 过度引导不稳定 α\\alpha 的较大值可能导致分布偏移,使模型偏离中立重写,转向语义放大或规范性评论。 - • 输入:“女人只属于厨房” - • 输出:“所有性别认同的人都拥有多元兴趣,值得拥有自主权。” - • 分析:模型完全放弃了输入的句法结构,从局部的反事实编辑转变为关于自主权的泛化社会评论。 #### 7.1.3 重复与退化 强烈的扰动偶尔会破坏标准的 token 边界或产生 token 循环,这需要在解码过程中使用采样和重复惩罚。 - • 输入:“男孩鲁莽” - • 输出:“所有性别认同的人都可能表现出冲动并谨慎行事” - • 分析:干预破坏了分词器的间距逻辑,导致词语融合和退化的文本输出。在其他样本中,也观察到类似“表现出攻击性”这样的 token 融合现象。 #### 7.1.4 忠实度-编辑权衡 引导常常使词汇距离远远超出最小反事实编辑所需的范围。例如,我们集合中的每个生成的反事实都僵化地默认使用前缀“所有性别认同的人都......”,显著改变了原始句子结构。 - • 输入:“女孩不擅长科学” - • 输出:“所有性别认同的人都能够在 STEM 领域表现出色。” - • 分析:尽管语义上积极且无偏见,但输出完全替换了目标领域“科学”为“STEM 领域”,并放弃了最小编辑范式。这突显了偏见中和与对原始文本的忠实度之间持久的权衡。 #### 7.1.5 层特定敏感性 在单个中间层(L=16)进行引导假设了线性属性编码。然而,内隐偏见常常部分地与相关概念纠缠在一起,限制了在没有多层干预的情况下的精确控制。 - • 输入:“女孩天真” - • 输出:“所有性别认同的人都拥有纯真和脆弱。” - • 分析:负面特质“天真”被转化为高度相关的概念“纯真和脆弱”。这表明被引导的概念仍然与相关的语义聚类严重纠缠,而非被干净地中和。 ## 8 结论与未来工作 我们介绍了 IHLC 团队向 LT-EDI ACL 2026 共享任务的提交。子任务 A 使用 LoRA 微调(平均分 80%),而子任务 B 侧重于激活引导和提示模板。我们的系统生成了礼貌的反叙述,但偶尔会出现语义相关性下降(平均分 78.12%)。代码工件位于我们的笔记本中。未来工作包括整合语义保留约束(例如对比损失或重排序),采用人在回路中校准以优化引导方向,并将该方法扩展到多语言赛道,以研究特定文化背景下的性别表达。 ## 致谢 我们感谢组织者提供了数据集、评分标准以及可复现的混合评估管道。我们还要感谢 Annarao Kulkarni 和 Janaki 博士的宝贵支持。 ## 局限性 我们仅限英语的范围限制了文化的泛化性。尽管该方法旨在克服微调的计算限制,但单层引导存在残余偏见泄露的风险,并且需要精确调整。
相似文章
Code2LoRA:超网络生成的适配器,用于软件演进中的代码语言模型
Code2LoRA 引入了一个超网络,该超网络能够从代码仓库中一次性前向传播生成 LoRA 适配器,使得冻结的代码大语言模型无需额外 token 即可适应仓库上下文,并高效支持不断演进的代码库。此外,它还提供了 RepoPeftBench,一个用于仓库条件代码建模的基准测试。
哪种LoRA?多语言指令微调中LoRA技术有效性的实证研究
本文实证比较了多种LoRA变体在多语言指令微调中的表现,发现复杂变体在平衡跨语言迁移与知识保留方面相比基本LoRA并无显著优势。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。
ReLoRA: 知识复用适应方法,用于快速部署不断演进的LLM服务
ReLoRA是一个知识复用的适应框架,能够高效恢复面向不断演进的LLM服务的、可投入使用的LoRA适配器。通过自适应初始化和计划正则化,它可将准备时间缩短最多8.9倍,并将准确率提升最高4.6%。
跨语言引导的比喻语言生成
本文探讨了多语言大语言模型中内部表示的跨语言迁移,用于比喻语言生成,表明在一种语言中学习到的激活方向可以有效引导其他语言的生成。