大规模人口统计提示:更多属性如何损害LLM与人类的一致性

arXiv cs.CL 论文

摘要

本文研究了在提示中添加人口统计属性如何影响LLM与人类在不同任务中的一致性,发现少数高信号属性能够提升对齐,但过度指定会降低对齐效果。研究使用五个开源LLM和神经元探测,表明属性信号质量和连贯性比数量更重要。

arXiv:2607.10590v1 公告类型:新 摘要:我们研究了作为提示线索提供的标注者人口统计属性如何影响大语言模型(LLM)预测与人类标注在五个任务中的对齐。使用五个开源LLM,我们系统性地改变提示中人口统计属性的数量和组合,涵盖了从单一属性到全属性配置的所有组合。实验揭示了三个主要发现。第一,对齐度始终在包含一到三个高信号属性时达到峰值,并在全属性集下下降,确立了明确的过度指定阈值。第二,人口统计属性对人类标注的总体影响程度并不能预测哪些属性会改善LLM对齐;相反,必须联合考虑每个属性标注信号的可学习性和方向连贯性。第三,神经元探测显示,只有在连贯的标注信号下,专门的激活才与对齐增益相关,并且激活量本身并不代表可操控性。总之,这些结果表明人口统计提示并非单一性干预:其效用高度依赖于上下文,受属性信号质量、任务特征和模型架构的影响。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:22

# 大规模人口统计提示:过多属性反而削弱LLM与人类标注的一致性
来源: https://arxiv.org/abs/2607.10590
查看PDF(https://arxiv.org/pdf/2607.10590)

> 摘要:我们研究了注释者的人口统计属性作为提示线索时,如何影响大语言模型(LLM)预测与人类标注之间的一致性。在五项任务中,我们使用五个开源LLM,系统性地改变提示中人口统计组件的数量与构成,涵盖了从单属性到全属性配置的所有组合。实验揭示了三个主要发现。首先,当包含一至三个高信号属性时,一致性达到峰值,而在全属性集下则下降,这明确划定了过度指定的阈值。其次,人口统计属性对人类标注的整体影响幅度并不能预测哪些属性能够提升LLM与标注的一致性;相反,需要综合考量每个属性标注信号的可学习性与方向一致性。第三,神经元探测表明,只有在一致的标注信号下,专门的激活才与一致性提升相关,并且仅凭激活量并不代表可引导性。这些结果共同说明,人口统计提示并非一种单一的干预手段:其效用高度依赖于上下文,受属性信号质量、任务特性和模型架构的共同影响。

## 提交历史

来自:Mahammed Kamruzzaman [view email(https://arxiv.org/show-email/1db305f2/2607.10590)] **[v1]** Sun, 12 Jul 2026 06:00:51 UTC (9,109 KB)

相似文章

大语言模型可通过正确提示更好地捕捉人类判断

arXiv cs.CL

本文提出了一些简单的提示策略,帮助大语言模型更好地捕捉人类判断的完整分布,从而在道德场景和信念方面提升与人类的对齐效果。作者表明,让模型报告标准差和响应比例,同时确保场景清晰度,能够获得与人类反应更一致的结果。

评估 LLM 在受控实验中作为人类代理的可靠性

arXiv cs.CL

本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。

在LLM个性化中重新聚焦人类

arXiv cs.CL

本文研究了在评估LLM个性化的三个阶段(属性提取、相关性匹配和响应生成)中,合成数据与人类数据之间的差距。结果表明,模型在真实人类数据上表现更差,作者引入了轻量级训练干预措施以改善对齐。

Review Arcade:论LLM评审的人类对齐与可游戏性

Hugging Face Daily Papers

本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。

LLM-as-Judge的几何学:为何LLM间共识并非人类对齐

arXiv cs.CL

本文从几何角度分析了为何作为裁判的LLM彼此之间高度一致,但与人类仅弱相关,发现LLM间共识在主观评分标准上反映的是坍塌子空间,而非真正的人类对齐。基于人类数据的后验校准提高了对齐,但即使经过校准的LLM也未达到人类的可靠性。