通过约束混合策略GroupDRO实现公平的系统提示选择
摘要
本文介绍了一种用于公平系统提示选择的约束混合策略GroupDRO框架,通过为现有提示分配权重,最小化不同人口统计组和指标上的最坏情况信息质量损失。在五个大语言模型上,针对双语医学和金融基准的实验表明,该方法在保持平均性能的同时,一致地降低了最坏情况下的质量下降。
arXiv:2608.04339v1 公告类型:新
摘要:大型语言模型越来越多地用于信息检索,但语义等价的措辞不同的问题可能会获得质量差异相当大的答案。系统提示被广泛用于引导响应行为,但它们通常针对平均情况质量进行优化,因此某些问题表述仍可能获得不完整或低质量的答案。为了解决这个问题,我们提出了一个用于系统提示选择的约束混合策略GroupDRO框架。该框架不是优化系统提示文本,而是为现有池中的系统提示分配权重,以最小化跨评估指标和组的最坏情况信息质量损失,同时约束平均损失使其接近基于平均选择的结果。由于池生成和选择是解耦的,该方法适用于任何系统提示池,并且可以利用互补系统提示的集成而不是单一提示。在五个大语言模型上,针对两个双语医学和消费金融基准,与无缓解措施相比,约束方法平均将整体均值、最差25%均值和最差值分别降低了13.1%、13.2%和13.7%,同时保持整体质量接近平均选择。其多提示权重揭示了指标-组对之间的互补性。代码和数据可在 https://github.com/Rainxu09/equitable-system-prompt-selection 获取。
查看缓存全文
缓存时间: 2026/08/06 07:46
# 基于约束混合策略 GroupDRO 的公平系统提示选择 Mengyu Xu1, Qiaoxin Yang2, Zhihan Liu3, Ruiyao Xu3, Zachary Liu4, Kezhen Chen5, Chongyang Gao3(通讯作者) ###### 摘要 大型语言模型越来越多地用于信息检索,但以不同方式表述的语义等价问题可能收到质量差异显著的答案。系统提示被广泛用于引导响应行为,但它们通常针对平均情况质量进行优化,因此某些问题表述仍然可能收到不完整或低质量的答案。为解决这一问题,我们提出了一个用于系统提示选择的约束混合策略 GroupDRO 框架。该框架不优化系统提示文本,而是对现有池中的系统提示分配权重,以最小化跨评估指标和组的最坏情况信息质量损失,同时约束平均损失使其接近基于平均的选择。由于池的生成与选择是解耦的,该方法适用于任何系统提示池,并且可以利用互补系统提示的集成,而非单一提示。在五个 LLM 和两个双语医疗与消费金融基准上,与无缓解相比,约束方法平均将总体均值、最差 25% 均值和最差值分别降低了 13.1%、13.2% 和 13.7%,同时整体质量与平均选择基本持平。其多提示权重揭示了指标-组对之间的互补性。代码和数据可在 https://github.com/Rainxu09/equitable-system-prompt-selection 获取。 ## 1 引言 大型语言模型(LLM)越来越多地用于健康和个人财务等高影响场景中的日常信息检索。在这些场景中,同一底层问题可以有多种表述方式。理想情况下,语义等价的问题应获得质量相当的答案。然而,在实践中,响应质量会随表述方式的不同而有显著差异,已有工作表明,LLM 对内容等价的输入可能产生不同的响应,具体取决于语言、领域素养、资源约束、方言、人设或框架信号(Xu等人 2026 (https://arxiv.org/html/2608.04339#bib.bib5);Hofmann等人 2024 (https://arxiv.org/html/2608.04339#bib.bib10);Gupta等人 2024 (https://arxiv.org/html/2608.04339#bib.bib12))。这种差异具有公平性维度:其表述方式表明领域素养较低的用户,恰恰是最难以自行填补缺失或被稀释信息的人,而健康素养较低与较差的健康结果相关(Berkman等人 2011 (https://arxiv.org/html/2608.04339#bib.bib11))。一种常见的缓解措施是添加系统提示来引导响应行为,例如指示模型保留关键信息或保持可操作细节。然而,无论是人工编写还是由自动提示优化器生成(Zhou等人 2023 (https://arxiv.org/html/2608.04339#bib.bib7);Yang等人 2024 (https://arxiv.org/html/2608.04339#bib.bib13);Guo等人 2024 (https://arxiv.org/html/2608.04339#bib.bib24);Agrawal等人 2026 (https://arxiv.org/html/2608.04339#bib.bib15)),系统提示通常都是根据其平均响应质量来选择的。一个平均表现良好的系统提示仍可能使特定的问题表述获得不完整或低质量的答案,而基于平均的选择机制无法检测或纠正这一点。我们在选择阶段解决这一问题。强候选系统提示已经大量存在,它们来自人工设计、LLM 生成或自动提示优化器,因此实际问题不是如何再编写一个提示,而是如何用好现有提示。此外,没有单一系统提示能完美适配所有问题表述,因此一种组合互补提示的方法能提供任何单一重写提示都无法提供的保护。我们在一个实用场景中定义该问题:给定有限的候选系统提示池、预定义的评估组以及每个候选的离线得分,我们询问如何从池中选择,使最弱的组也能获得高质量答案。这些条件使问题可精确求解,而非一个学习任务。对于有限池和完全观测的得分,不存在需要泛化的
相似文章
对话推荐系统中用户模拟的提示优化:一个多目标框架
本文提出了一种框架,用于自动优化基于LLM的对话推荐系统用户模拟器的提示,解决了正向偏差和行为多样性有限等问题。
GroupDPO:内存高效的分组直接偏好优化
GroupDPO 引入了一种内存高效的分组直接偏好优化算法,该算法利用每个提示的多个候选响应,通过解耦反向传播来减少峰值内存使用。该方法在离线和在线对齐设置中均展现出相比标准 DPO 的持续改进。
通过引导进行嵌入:系统提示贝叶斯优化的动态表示
介绍ReElicit,一个贝叶斯优化框架,利用大型语言模型(LLM)来引导和调整特征空间,在聚合标量反馈下优化系统提示,在十个基准任务上取得了强劲性能。
面向比较图的可靠LLM评估的提示扰动
提出了一种提示扰动框架,该框架生成扰动的提示变体,通过图级一致性检查过滤掉结构不一致的比较模式,然后应用标准排名方法产生更可靠的LLM排名。
BiasGRPO:通过群体相对策略优化稳定高方差奖励环境中的偏见缓解
BiasGRPO 提出了一种利用群体相对策略优化(GRPO)的框架,通过对采样补全结果的奖励进行归一化,稳定 LLM 中社会偏见的缓解过程,在多个基准测试上优于 DPO 和 PPO。作者还发布了一个计算高效的偏见奖励模型,可无缝集成到多目标 RLHF 流水线中。