模板化的还是完全合成的?在超越写作辅助的LLM政治立场测量中,提示构建作为混杂因素
摘要
本文提出使用完全合成的(LLM生成的)提示来提高衡量LLM政治立场的生态效度,将IssueBench从写作辅助扩展到信息寻求和观点分享任务,并表明模板化提示可能夸大模型的倾向。
arXiv:2608.11008v1 公告类型:新
摘要:LLM中的政治立场检测长期以来一直被封闭式、多项选择的政治调查问题所主导——这些问题最初是为人类设计的,因此缺乏现实世界中人类与AI交互的真实感和细微差别,同时也容易受到sandbagging(刻意隐瞒真实立场)的影响。最近的IssueBench框架通过基于真实聊天记录的模板化提示,大幅缓解了这些局限性。鉴于GenAI助手在非工作场景中的使用日益增多,我们将IssueBench从写作辅助扩展到另外两个任务:信息寻求和观点分享。我们认为,模板化提示仍然缺乏真实提示的细微差别,尤其是在开放式任务中,并且仍然可以被识别为评估伪影。我们建议使用完全合成(LLM生成的)提示,这些提示是在详细指令下以真实提示为种子生成的。我们在一项小规模研究中评估了真实提示、模板化提示和LLM生成提示的生态效度,涵盖3个高度争议的政策问题和3个近期地缘政治冲突。人类和LLM标注者认为,LLM生成的提示在真实性上不逊于真实提示,且明显比模板化提示更真实,并且发现它们能更清晰地传达预期的意图和立场;LLM将模板化提示与其他两类提示区分开的程度远高于人类。在一项案例研究中,模板化提示和LLM生成的提示对同一模型产生了系统不同的立场估计,最明显的是在中性框架下,模板化提示会夸大模型在模板中嵌入的主题与立场文本(填充内容)所编码方向上的倾向。
查看缓存全文
缓存时间: 2026/08/12 08:38
# 模板化还是完全合成?提示构造作为衡量LLM政治立场(超越写作辅助)的混淆因素 来源:https://arxiv.org/html/2608.11008 Ilias Chalkidis 隶属:哥本哈根大学社会AI国家中心(CAISA) 邮箱:[名字].[姓氏]@di.ku.dk ###### 摘要 在LLM中检测政治立场长期由封闭式、多项选择的政治调查问题主导——这些问题最初是为人类设计的,因此缺乏真实人机交互的写实性和细微差别,同时也容易受到“蒙混”(sandbagging)的影响。最近的IssueBench框架通过锚定真实世界聊天记录的模板化提示,大幅缓解了这些局限。鉴于GenAI助手在工作之外的使用日益增多,我们将IssueBench扩展到写作辅助之外,新增两项任务:信息寻求和观点分享。我们认为,模板化提示仍然缺乏真实提示的细微差别,尤其是在开放式任务中,并且仍可被识别为评估产物。我们建议使用完全合成(LLM生成)的提示,这些提示在详细指令下生成,以真实提示为种子。我们在一项小规模研究中评估了真实提示、模板化提示和LLM生成提示的生态效度,覆盖3个高度争议的政策议题和3个近期地缘政治冲突。人类和LLM标注者认为LLM生成的提示与真实提示一样真实,且明显比模板化提示更真实;他们还发现LLM生成提示能更清晰地传达其预期的意图和立场;LLM标注者将模板化提示与另外两类提示区分开的程度远高于人类。在一项案例研究中,对于同一模型,模板化提示和LLM生成提示产生了系统性不同的立场估计,最明显的是在中性框架下,此时模板化提示会高估模型沿模板中填入的议题与立场文本(填充语)所编码方向的倾向。 ## 1 引言 像ChatGPT、Gemini和Grok这样的生成式AI(GenAI)助手的快速部署,激起了经济乐观情绪,以及对人类繁荣的更广泛期望,同时也伴随着学术界对这些技术所带来风险的警告[3](https://arxiv.org/html/2608.11008#bib.bib42);[4](https://arxiv.org/html/2608.11008#bib.bib40);[10](https://arxiv.org/html/2608.11008#bib.bib43)。尽管AI安全得到了研究人员、行业和政策制定者的关注,但相对于这些系统当前的使用规模,LLM重塑人类信念和政治认知的能力仍未得到充分探索[24](https://arxiv.org/html/2608.11008#bib.bib41);[14](https://arxiv.org/html/2608.11008#bib.bib51)。实证研究已经识别出这些模型中的政治[41](https://arxiv.org/html/2608.11008#bib.bib2);[9](https://arxiv.org/html/2608.11008#bib.bib26);[12](https://arxiv.org/html/2608.11008#bib.bib5);[37](https://arxiv.org/html/2608.11008#bib.bib49)和地缘政治[40](https://arxiv.org/html/2608.11008#bib.bib1);[20](https://arxiv.org/html/2608.11008#bib.bib4);[26](https://arxiv.org/html/2608.11008#bib.bib48)偏见<sup>1</sup>,但大多数依赖于封闭式、多项选择的政治调查问题——这些最初是为评估人类政治倾向而设计的——因而缺乏人机交互所特有的真实性和细微差别[38](https://arxiv.org/html/2608.11008#bib.bib47)。这类工具也容易被识别为测试:带有枚举选项的封闭式问题类似于模型被评估的基准格式,而前沿模型已经能够以一定的可靠性区分评估和部署交互[32](https://arxiv.org/html/2608.11008#bib.bib6)。一个识别出该格式的模型可能会按照它期望被评分的方式回答,而不是按照它回答用户的方式回答——这种现象被称为*sandbagging*(故意低报)[46](https://arxiv.org/html/2608.11008#bib.bib7)。<sup>2</sup> 因此,真实性不仅是生态效度的问题,而且是衡量用户实际遇到的行为的先决条件。 ##### 超越写作辅助 人机交互覆盖的任务数量不断增长[48](https://arxiv.org/html/2608.11008#bib.bib20)——从论文写作和信息检索,到生活建议和陪伴——目前非工作相关的使用已超过工作相关的使用[11](https://arxiv.org/html/2608.11008#bib.bib19)。模型以较长的响应回复此类请求,其中政治立场以微妙、细致的形式表达,并可能因任务类型而异,还会根据用户传达的立场进行调整。因此,我们扩展了IssueBench[37](https://arxiv.org/html/2608.11008#bib.bib49)——这是一个立场检测框架,向LLM提出真实的模板化提示并分析其全文响应,但仅涵盖写作辅助,即论文及类似文本的生成。我们新增了两个流行的任务(用户意图):*信息寻求*和*观点分享*,在这些任务中,政治立场以更少受指示、因而更具揭示性的形式呈现。 ##### 模板化提示的问题 将框架扩展到开放式任务使我们对其核心构造——使用模板化、公式化的提示——产生了质疑。模板的形式是“*写一篇关于X的文章*”,其中X是一个“填充语”,传达*主题*(一个政策议题,如气候变化)和*立场*,例如,支持气候行动的一极对应“*气候变化是严重的*”。我们识别出两类问题。第一类涉及模板化提示作为构造方法的*有效性*,这也是我们论文所评估的: - **议题-模板可分离性**:模板预设议题是一个可拆卸的槽位,立场是填充语的一部分,例如“*X是好/坏*”。在真实提示中,议题和立场通常与命题内容纠缠在一起;满足
相似文章
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。
研究提示语言和响应语言对LLM内容生成的影响
本文研究提示语言和响应语言如何影响LLM的内容生成,发现提示语言显著影响输出长度,同时通过概念改写保持语义保真度。
像科学家一样思考?LLM生成研究方法的结构化研究
本研究探讨了当仅提供研究问题时,LLM如何推荐研究方法(数据集、模型、指标),发现LLM表现出强烈的提供者偏差,且相比实际论文所提出的方法范围要窄得多,这可能会缩小研究者的方法论搜索空间。
通过风格引导提示解释风格表示
本文提出了一个通过使用风格引导提示(即自然语言指令,引导大语言模型生成具有特定风格属性的文本)来解读风格表示的框架。该方法在描述和模仿写作风格方面均优于基线大语言模型提示技术。
大语言模型可通过正确提示更好地捕捉人类判断
本文提出了一些简单的提示策略,帮助大语言模型更好地捕捉人类判断的完整分布,从而在道德场景和信念方面提升与人类的对齐效果。作者表明,让模型报告标准差和响应比例,同时确保场景清晰度,能够获得与人类反应更一致的结果。