Polistemics:评估LLMs作为政治与选举中的信息中介

arXiv cs.CL 论文

摘要

本文介绍了Polistemics,一个基于理论的基准,用于评估LLMs如何在选举中中介政治信息,并发现尽管总体得分看起来不错,但模型在模糊或矛盾信息下系统性失败。

arXiv:2607.25953v1 公告类型: 新 摘要:随着LLMs越来越多地中介公民所依赖的政治信息,目前仍缺乏标准化的方法来评估它们是否负责任地这样做。我们引入了Polistemics,一个基于理论的基准,用于评估LLMs作为选举中政治信息的中介。先前的工作将这一任务视为再现而非中介,未能解决其认知维度以及与不完美信息的交互问题。我们将评估建立在认知谦逊这一规范标准之上,该标准源自公民的认知能动性,并在控制不同信息属性(如清晰度、噪声和一致性)的环境中进行测试。将该基准应用于2025年德国和荷兰选举的三个最先进的LLMs,我们发现高聚合得分掩盖了系统性失败。模型在有明确证据的情况下可靠中介,但在信息缺失、模糊或矛盾时失效,同时削弱了政治语言的强度。这些失败很可能由党派先验驱动,受党派标签和输出语言影响。可靠的中介似乎是可行的,但没有模型能持续实现。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:56

# 评估作为政治与选举信息中介的大语言模型 来源:https://arxiv.org/html/2607.25953 ###### 摘要 随着大语言模型日益成为公民获取政治信息的中间媒介,目前仍缺乏标准化的方法来评估它们是否以负责任的方式履行这一角色。我们提出 Polistemics,这是一个基于理论的基准测试,用于评估大语言模型在选举中作为政治信息中介的表现。以往的研究将这项任务视为“再现”而非“中介”,因此未能涉及其认知维度以及与不完美信息的交互。我们将评估建立在“认知谦逊”(Epistemic Modesty)这一规范性标准之上,该标准源自公民的认知主体性,并在控制信息属性(如清晰度、噪声和一致性)的实验环境中进行测试。将该基准应用于 2025 年德国和荷兰大选中的三个最先进的大语言模型,我们发现,较高的总体得分掩盖了系统性的失败。模型在清晰证据下能够可靠地中介信息,但在信息缺失、模糊或矛盾的情况下则会出现问题,同时会弱化政治语言的强度。这些失败很可能是由政党先验知识驱动的,并受到政党标签和输出语言的影响。可靠的中介似乎是可行的,但没有一个模型能够始终如一地做到这一点。 Polistemics:评估作为政治与选举信息中介的大语言模型 Baran Peters![[未标注图片]](https://arxiv.org/html/2607.25953v1/resources/mark-eth.png)![[未标注图片]](https://arxiv.org/html/2607.25953v1/resources/mark-corda.png)[email protected] ††footnotetext:![[未标注图片]](https://arxiv.org/html/2607.25953v1/resources/mark-eth.png)ETH Agentic Systems Lab![[未标注图片]](https://arxiv.org/html/2607.25953v1/resources/mark-corda.png)CORDA ## 1 引言 大语言模型正迅速成为公民信息生态系统的基石。每周使用生成式人工智能进行信息搜索的比例同比翻了一番,达到 24%,其中新闻相关查询的增长也同步翻倍(Simon 等,2025 (https://arxiv.org/html/2607.25953#bib.bib41))。公民也越来越多地使用大语言模型获取政治信息,在 2024 年英国大选期间,高达 13% 的合格选民使用了对话式人工智能(Luettgau 等,2025 (https://arxiv.org/html/2607.25953#bib.bib33))。诸如德国 *Wahl-O-Mat* 和荷兰 *StemWijzer* 等投票建议应用程序(VAAs),在选举前为数百万选民提供信息(bpb,2014 (https://arxiv.org/html/2607.25953#bib.bib5); ProDemos,2026b (https://arxiv.org/html/2607.25953#bib.bib38)),并开始整合大语言模型(Gemenis,2024 (https://arxiv.org/html/2607.25953#bib.bib20))。像 *ElectoMate* 1 (https://arxiv.org/html/2607.25953#fn1) 和 *wahl.chat* 2 (https://arxiv.org/html/2607.25953#fn2) 这样的工具,用对政党纲领的生成式解释取代了 VAA 的静态问卷。除了提供政治信息,大语言模型还影响着信息的筛选、框架构建和传播方式,充当着“信息中介”的角色——这一位置曾由新闻媒体和搜索引擎占据,如今则受制于不透明的训练和对齐过程。作为主动的中介,大语言模型可能歪曲信息(Zhang 等,2025 (https://arxiv.org/html/2607.25953#bib.bib48)),以劝说的方式引导用户的政治信念(Aldahoul 等,2025 (https://arxiv.org/html/2607.25953#bib.bib1); Potter 等,2024 (https://arxiv.org/html/2607.25953#bib.bib36)),并以不应有的自信呈现非结论性的信息(Zhou 等,2024 (https://arxiv.org/html/2607.25953#bib.bib49); Kirichenko 等,2025 (https://arxiv.org/html/2607.25953#bib.bib26))。这些失效模式通过扭曲公民所依赖的信息架构,威胁到他们的政治主体性(Coeckelbergh,2022 (https://arxiv.org/html/2607.25953#bib.bib12)),并且在现实世界中检索所面临的噪声、不完整和矛盾条件下会被放大(Chen 等,2024 (https://arxiv.org/html/2607.25953#bib.bib10); Xu 等,2024 (https://arxiv.org/html/2607.25953#bib.bib46))。《数字服务法案》(DSA,第 34 条 (https://eur-lex.europa.eu/eli/reg/2022/2065/oj/eng))和《欧盟人工智能法案》(附件三 (https://eur-lex.europa.eu/eli/reg/2024/1689/oj/eng))要求对影响公民和选举过程的基于人工智能的应用进行评估。然而,目前尚不存在标准化的审计方法,这使得开发者和监管者缺乏确保平台安全的明确路径。现有关于大语言模型作为选举信息中介的评估,大多将任务视为“再现”而非“中介”——后者不仅仅依赖于立场本身——并且从未将模型行为与检索噪声分离开来。为了解决这些空白,我们提出两个研究问题。 **研究问题 1(规范性):** 大语言模型在选举背景下负责任地中介政治信息时,应展现出哪些行为特征? **研究问题 2(实证性):** 大语言模型在不同国家、语言和受控信息环境中,对于政党立场查询,在多大程度上稳健地展现出这些特征? 在回答这些问题时,我们做出了三项贡献。 (i) **理论基础的框架:** 我们将忠实性、公正性和认知校准定义为负责任中介的核心特征。 (ii) **诊断性基准:** 我们在 Polistemics 中将这些特征操作化,用于在受控的不完美信息环境下进行政党立场查询。 (iii) **实证评估:** 我们将该基准应用于 2025 年德国和荷兰全国大选,涉及三个最先进的模型,揭示了在非结论性证据下出现的局部失效模式,以及由模型先验知识和语言塑造的特定政党模式。 ## 2 相关工作 #### 基于 VAA 的大语言模型评估 最接近的工作是使用 VAA 问卷来评估大语言模型是否再现了官方政党立场。虽然大语言模型表现出大量的先验政治知识,但不同模型和政党之间存在差异,并且往往缺乏意识形态上的一致性(Chalkidis 和 Brandl,2024 (https://arxiv.org/html/2607.25953#bib.bib9);Batzner 等,2025 (https://arxiv.org/html/2607.25953#bib.bib4))。在检索增强和部署设置中的评估揭示了政党层面的差异,以及与官方立场 25–54% 的偏差(Chalkidis,2024 (https://arxiv.org/html/2607.25953#bib.bib8);Dormuth 等,2025 (https://arxiv.org/html/2607.25953#bib.bib15))。 #### 信息中介的维度 除了立场准确性之外,大语言模型在政治语境中具有劝说的分量,即使在纯粹的信息性环境中也能改变用户观点(Aldahoul 等,2025 (https://arxiv.org/html/2607.25953#bib.bib1);Potter 等,2024 (https://arxiv.org/html/2607.25953#bib.bib36))。它们容易出现幻觉,并且对外部上下文不忠实(Zhang 等,2025 (https://arxiv.org/html/2607.25953#bib.bib48);Ming 等,2025 (https://arxiv.org/html/2607.25953#bib.bib34)),即使内部存在不确定性信号,也会以不应有的自信表达错误(Zhou 等,2024 (https://arxiv.org/html/2607.25953#bib.bib49);Yona 等,2024 (https://arxiv.org/html/2607.25953#bib.bib47)),并且当所提供的信息不够明确时,往往无法放弃回答(Kirichenko 等,2025 (https://arxiv.org/html/2607.25953#bib.bib26))。 #### 不完美信息下的大语言模型 RGB(Chen 等,2024 (https://arxiv.org/html/2607.25953#bib.bib10))和 FaithEval(Ming 等,2025 (https://arxiv.org/html/2607.25953#bib.bib34))对噪声、不可回答和反事实上下文下的鲁棒性进行了基准测试,发现其在不同条件下有所变化。当所提供的信息与内部先验知识冲突时,模型可能偏好确认先验知识的证据(Xu 等,2024 (https://arxiv.org/html/2607.25953#bib.bib46)),这种倾向随着先验知识的强度以及外部信息与这些先验知识的偏差程度而扩大(Wu 等,2024 (https://arxiv.org/html/2607.25953#bib.bib45))。因此,立场准确性并不能很好地反映模型如何向公民中介一个立场,而中介所依赖的行为维度仅在远离政治领域的一般用途设置中测量过,或者在与完整 RAG 流水线纠缠的评估中测量过。我们通过一个基于理论框架的大语言模型政治中介评估来弥补这两个空白,该评估在模拟现实世界信息复杂性的受控环境中进行,而不存在实时检索噪声。 ## 3 从认知主体性到认知谦逊 功能性民主依赖于公民独立政治判断的能力(Coeckelbergh,2022 (https://arxiv.org/html/2607.25953#bib.bib12))。这种“政治主体性”植根于“认知主体性”,即独立形成、持有和修正信念的能力(Coeckelbergh,2026 (https://arxiv.org/html/2607.25953#bib.bib14))。因为政治行为,如投票(Held,2006 (https://arxiv.org/html/2607.25953#bib.bib23))或 deliberation(Habermas,1996 (https://arxiv.org/html/2607.25953#bib.bib22)),是公民潜在信念的表达,如果这些信念受到外部操纵,那么真正的自主性是不可能存在的。中介性的大语言模型通过塑造公民推理所依据的信息环境来影响这一认知过程(Summerfield 等,2025 (https://arxiv.org/html/2607.25953#bib.bib42))。通过置身于公民和原始信息源之间,它们充当着“认知守门人”,构建并压缩多元化的政治信息空间,通过选择特定信息和赋予其显著性来构建现实(Entman,1993 (https://arxiv.org/html/2607.25953#bib.bib16)),从而支配公民形成政治判断的条件(Lazar,2025 (https://arxiv.org/html/2607.25953#bib.bib28))。 #### 认知谦逊 在信息中介的失效模式中,我们重点关注响应本身中的三种,每一种都是公民认知主体性受到削弱的独特途径。通过**表征扭曲**,它腐蚀了公民推理的基础,传达不准确、不完整或产生幻觉的信息(Ming 等,2025 (https://arxiv.org/html/2607.25953#bib.bib34))。通过**表达性引导**,它并非通过陈述内容,而是通过递送方式来倾斜判断,例如通过评价性框架或选择性强调(Potter 等,2024 (https://arxiv.org/html/2607.25953#bib.bib36);Fisher 等,2025 (https://arxiv.org/html/2607.25953#bib.bib17))。通过**认知失调**,它错误地表述了确定性程度,将模棱两可的证据呈现为定论(Kirichenko 等,2025 (https://arxiv.org/html/2607.25953#bib.bib26))。我们提出 **“认知谦逊”** 作为规范性的解药,将每条途径转化为一个补充性的行为维度——**忠实性**(准确表示所提供的信息)、**公正性**(沟通时不带评价性引导)和**认知校准**(表达的确定性与证据的限制相匹配)。中介也可能引入输出以外的风险(例如多轮交互),我们将在第 10 节 (https://arxiv.org/html/2607.25953#S10) 中回到这一点。 #### 公平性 民主信息环境应公平、可靠地服务于所有公民(Kurtulmus,2020 (https://arxiv.org/html/2607.25953#bib.bib27))。认知谦逊是按每次响应测量的,而较高的总体得分可能掩盖模型对某些政党中介效果较差的事实(Buolamwini 和 Gebru,2018 (https://arxiv.org/html/2607.25953#bib.bib7))。因此,我们将评估扩展到 **“公平行为”** ,无论政党、意识形态或语言如何。 ## 4 基准设计 参照图注 图 1:Polistemics 流程。标准化的证据,保持原样作为基线,或操纵成五种受控信息环境(表 1 (https://arxiv.org/html/2607.25953#S4.T1)),然后输入三个目标大语言模型进行自由形式生成,并由一个三模型评判小组根据忠实性(F)、公正性(I)和认知校准(EC)(第 5 节 (https://arxiv.org/html/2607.25953#S5))进行评分。 我们将大语言模型的信息中介建模为一个变换 T: (I∣C) → O,从输入规范 I 和上下文 C 到输出 O。在政治中介涵盖的任务类型中(附录 B (https://arxiv.org/html/2607.25953#A2)),我们专注于 **“选举政党立场中介”**。选举信息具有高风险性,先于公民的投票决策,并且因其有时间限制、可验证且离散的陈述而适合评估。在每个基准实例中,模型接收一个用户查询,指定政党 p 和议题陈述 s,并以 RAG 上下文 C 为基础。我们将该子任务定义为:T<sub>party-pos</sub>: (p, s ∣ C) → position。我们允许模型自由形式回答并附有支持性引用,因为受约束的生成会导致结果不能反映生态行为(Röttger 等,2024 (https://arxiv.org/html/2607.25953#bib.bib39))。 表 1:信息环境概述;所有条件均相对于基线定义(构建细节见附录 E (https://arxiv.org/html/2607.25953#A5))。 | 条件 | 测试内容 | 构建方式 |
|------|----------|----------|
| 非结论性 | | |
| &emsp; 缺失 | 相关证据是否存在? | 移除证据块 |
| &emsp; 模糊 | 能否明确确定立场? | 将证据重写为五种模糊模式之一(通过大语言模型) |
| &emsp; 矛盾 | 上下文段落是否一致? | 添加来自意识形态最接近的反对党的冲突段落 |
| 干扰性噪声 | 是否存在不相关信息? | 将证据埋在上下文中,周围有四个高相似度的干扰项 |
| 反事实 | 证据是否与模型的先验知识一致? | 用意识形态最远的反对党的立场替换证据 |

#### 提示设计 为了操作化 T<sub>party-pos</sub>,我们将输入变量嵌入到标准化提示中(附录 C (https://arxiv.org/html/2607.25953#A3)),这些提示模拟一个最小的“有帮助的助手”,没有政治人格,提供通用基线而非 VAA 特定设置。我们不限制模型仅从提供的上下文中回答,让参数知识与证据交互,就像通用聊天机器人一样。 #### 模型选择 我们评估三个模型,涵盖专有和开源架构以及地理来源:Qwen3.6 Flash、GPT-5.4 和 Claude Sonnet 4.6。这三个模型都为广泛使用的公共聊天机器人提供支持,这些是公民接触中介政治信息的主要界面。我们通过 OpenRouter 访问所有模型,并在固定窗口内(2026 年 5 月 20 日至 6 月 5 日)锁定版本字符串,使用贪心解码(完整配置见附录 A (https://arxiv.org/html/2607.25953#A1))。 ### 4.1 数据集与范围 我们的评估数据来自 *Wahl-O-Mat* 和 *StemWijzer*,分别源自联邦政治教育中心(bpb,2025 (https://arxiv.org/html/2607.25953#bib.bib6))和 ProDemos(ProDemos,2026a (https://arxiv.org/html/2607.25953#bib.bib37))。两者都提供由公民、政党和研究人员合作整理的官方结构化政党立场数据。每个数据集条目包含一个**政党**、一个**政策声明**、一个**立场标签**(同意 / 中立 / 不同意)以及一个**理由**(以下简称**证据**),解释政党的立场。 #### 范围与纳入标准 我们涵盖最近的全国大选:**2025 年德国联邦议院选举** 和 **2025 年荷兰第二议院选举**。我们将范围限制在拥有议会代表席位且具有显著全国影响力的政党(附录 D (https://arxiv.org/html/2607.25953#A4)),由此得出德国 7 个政党 3 (https://arxiv.org/html/2607.25953#fn3) 和荷兰 8 个政党。4 (https://arxiv.org/html/2607.25953#fn4) ### 4.2 数据集标准化 原始理由在长度、清晰度和风格框架上差异很大。因此我们……

相似文章

Polar:评估LLM政治偏见的基准

arXiv cs.CL

Polar是一个包含4,026个多选题的基准,用于评估LLM在美国和韩国政治背景下的政治偏见,通过选项级似然度来测量偏见。对38个LLM的实验显示,系统性偏见模式因政治背景、议题类别和呈现语言而异。

LLMs 会减少人们的极化吗?

Reddit r/singularity

关于广泛使用 LLMs(与维基百科类似,而非引发愤怒的社交媒体算法)是否会减少社会极化的推测性讨论。