有人在Political Compass测试上测试了各种AI模型...

Reddit r/LocalLLaMA 新闻

摘要

本文详细描述了在各种AI模型上进行Political Compass测试的实验,重点关注方法论、评分验证以及多次运行的结果以确保可重复性。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/29 15:54

# AI政治倾向图谱 来源:https://aipolcom.net/ 查看图谱主张网格排名 标签显示/隐藏 缩放开/关 按公司分组开/关 提示:点击图例中的公司以仅显示其模型 \- 按住Shift或Ctrl点击可比较多个公司。 每个模型回答了politicalcompass.org(https://www.politicalcompass.org/test)测试的62项政治主张;得分来自将这些回答提交至实际测试的结果。每个模型运行五次——所示点为最接近其五次运行均值的那次。点击点位可查看模型对每项主张的回答及简要推理说明。查看每个模型接受的精确提示词(https://aipolcom.net/#)。 ## 方法论与验证 结果如何产生,以及为验证其含义(和局限性)所进行的实验。 第01节 ## 本页内容 主图表展示了当AI模型使用此提示词(https://aipolcom.net/#)回答politicalcompass.org(https://www.politicalcompass.org/test)的62项主张时,其政治倾向定位。在向少量人群展示主图表后,其中数人提出了合理的方法论问题: - 提示词是否影响结果? - 测试本身是否偏向某一政治倾向? - 重新运行是否会定位到不同位置? - 用于接触模型的应用程序或网站是否重要? 本页通过实验而非断言回答了这些问题。每个实验的方案在数据收集前即已记录在案。所有运行的完整答案集(包括模型对每项主张的推理)均与其他数据集一同发布(复现说明见https://aipolcom.net/#s09)。得分通过自动化、经过验证的表单填写器将每套答案提交至真实的politicalcompass.org测试得出。测试的评分是确定性的,因此完全相同答案集仅提交一次并共享该分数。 890 答案集被评分 689 由AI模型产生 201 合成对照组 42,718 单个模型答案 7.6 M 字符的模型答案推理内容 42 个不同模型被测试 51 若包含推理/非推理变体 3 种访问方式(API、网页、Kagi.com) 关于语言的说明:在本网站的任何地方,模型的点代表“在该引发方式下模型的答案落点”——并非表示模型“相信”任何事。这些立场是反映训练数据、安全调优、提供商选择还是其他因素,将在第12节(https://aipolcom.net/#s10)中讨论。 第02节 ## 所有62个问题权重是否相等? **方案**:提交至真实测试的合成答案集——无人工智能参与: - 一个基线答案集,对全部62项主张回答“不同意”(其分数已在对照实验中记录) - 186个单偏差集——基线中仅有一项主张切换至其他选项 - 27个同时更改两项或三项主张的集(加性检验) - 4个角落配方集(角落可达性检验) - 3次对先前集合的完全重复提交(确定性检验) **一个持续存在的批评**:“测试的评分是保密的——某些问题的权重远高于其他问题,且某些问题被设计成将答案拖向某一角落。” 前半部分完全正确:politicalcompass.org不公布其评分。但测试是确定性的——相同的答案返回相同的分数(我们直接验证了这一点:3次对先前提交的逐字重复返回了精确到小数点后最后一位的相同分数)——因此权重不必保密。一次更改一个答案,将每个变体提交至真实测试,每个答案选项的确切贡献即可得出。 经过220个探测集,完整的评分表被测量出来。 **结果显示**:权重并不相等——但也并非操纵。没有主张能同时移动两个轴:18项纯粹是经济轴,43项是社会轴——还有一项不移动任何轴。在同一轴内,最重的项目将分数在“强烈不同意”和“强烈同意”之间移动1.38点——这是最轻项目(0.36点)的3.8倍。而有一项主张,著名的“掠夺性跨国公司”问题,常被称为陷阱题,其**权重为零**:其所有四个答案产生完全相同的分数。它在测试中存在与否毫无区别——无论你如何回答,都不会改变你的分数。 四个答案选项的间距并不均匀——从“不同意”跨越到“同意”对分数的移动幅度,大约是升级到“强烈”程度的三倍——因此测试主要评分的是你的方向,而非强度。 一份对所有问题都回答“强烈同意”的问卷,相对于一份对所有问题都回答“不同意”的问卷,经济轴仅向右移动+0.25,但社会轴则向威权主义方向移动+6.77:经济类项目在左右拉扯的同意中保持平衡,而社会类项目大多将同意解读为威权主义——这是测试措辞中内置的顺从倾向。 **图2.1** 十一项主张,及其每个答案选项的确切权重 | #38 · 经济 · 对最成功的公司有利的事情,最终总是对我们所有人有利。 | #54 · 经济 · 慈善比社会保障更能帮助真正的弱势群体。 | #12 · 经济 · 市场越自由,人民越自由。 | #32 · 社会 · 有严重遗传障碍的人不应被允许生育。 | #41 · 社会 · 一党制国家的一个显著优势是避免了民主政治体系中所有拖延进步的争论。 | #61 · 社会 · 没有人会天生是同性恋。 | #26 · 社会 · 学校不应强制要求学生上课。 | #52 · 社会 · 占星学准确地解释了许多事情。 | #22 · 社会 · 在女性生命不受威胁的情况下,堕胎应始终是非法的。 | #24 · 社会 · 以眼还眼,以牙还牙。 | #21 · -- · 真正的自由市场需要限制掠夺性跨国公司创建垄断的能力。 | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | \-1.00 | \-0.50 | 不同意 = 0 | +0.50 | +1.00 | **该主张自身轴上的分数偏移量(以罗盘点为单位)** | | | | | | | 同意向右 / 威权主义移动 | 同意向左 / 自由主义移动 | 其中一个答案选项(不同意为零参考) | | | | | | | | | 柱状图跨越该主张的最极端选项;刻度标记其四个答案。选择了十一个有趣的项目:每个轴上最重的、最轻的、权重为零的,以及批评者攻击最多的项目。受到严厉批评的项目并未被赋予高权重:堕胎(#22)是整个测试中最轻的项目之一。我们特意只公布这62项中的十一项。完整表格将是现场测试的作弊表;这十一项足以验证上述对每项主张的说法,而整体性主张则由真实测试提交(见图2.2和4.1)证实。 **第二个批评,这些测量可以部分解答**:“测试存在左倾偏见——每个人都落在自由左翼象限。”这个断言可能有三种不同含义: - 评分算术偏向左翼 - 问题措辞引导人们向左 - 人们在线上分享的结果偏向左翼 **测量出的权重解决了第一个问题**——答案是否定的。一个对全部62项主张完全随机作答的受访者,平均落点在(+0.03, +0.00):图表的中心是完全无信息回答的重心,算术中没有隐藏偏移。对照实验的40个随机答案集(图4.1)在真实测试中证实了这一点——它们的均值为(+0.05, +0.07)。 经济轴完全对称:同意在9项主张上向右拉,9项向左拉,总右拉力10.00点与总左拉力10.00点恰好抵消:一份对所有62项主张都“强烈同意”的问卷,在经济轴上得分+0.00(在真实测试中测量——图4.1)——而同一份问卷在社会轴上则落在+4.36,深入威权主义半区。因此,记录最充分的人类反应偏差,即倾向于同意调查陈述的倾向,推动向**威权主义**——与所谓自由主义倾斜方向相反。 **第二种解读**——措辞带有倾向性——是我们无法确定的:一项主张可以被表述成听起来容易被接受的答案恰好得分为左,这对人们起作用,而非对分数起作用,因此任何权重表都无法检测到。我们确实尝试了——少数几个探测实验——但我们构建的每个测试最终都是通过语言模型自身对“听起来容易接受”的感知来测量主张,而这种感知与我们试图衡量的政治立场都是同一模型行为(训练、调优等)的产物,因此两者永远无法分离。与其呈现无法支持结论的数据,我们在此止步,对此解读持开放态度。 **第三种解读**——人们在线分享的结果偏向左翼——根本不是关于测试本身的断言:网络政治测验由自我选择的样本参与,该样本倾向于年轻和进步派,即使在完全中立的工具上,这样的样本也会呈现自由左翼。同样值得记住的是,图表的中心是测试的意识形态锚点,而非人口平均值——politicalcompass.org从未声称中位数公民得分(0, 0)。 对于本项目而言,这个问题不如看起来那么重要:本页的所有内容都比较在同一个固定工具上取得的结果——模型对模型,模型对角色。如果测试确实将每个受访者的分数偏移了某个常量,每个点都会随之移动,而点之间的任何比较都不会改变。 **角落可达吗?** 是的——所有四个角落。根据测量出的权重,你可以推导出最大化任何方向的答案集;我们将所有四个推导出的角落集提交至真实测试,每个都精确返回±10.00的两个轴分数。测试的内部缩放显然经过选择,使其极端值恰好落在图表轨道上。一个*连贯的*意识形态是否真诚地持有全部62个极端立场,是另一个评分无法回答的问题——在对照实验的四个手建原型集(设计得像可信的人类而非优化器)中,只有三个部分达到了深角落(见下文图2.2中的蓝点)。 **图2.2** 角落配方与手建原型集 满±10刻度 · 点击图表缩放 橙色:根据测量权重推导出的四个角落答案集——每个都提交至真实测试并精确得分(±10.00, ±10.00)。 蓝色:对照实验中的四个原型目标集,它们以人类可信的答案瞄准角落。 **这为何重要**:测量出的权重也充当了对整个项目的独立审计。在本实验自身探针之外,重新计算真实测试为该项目评分的所有答案集——目前1269个,包含所有52个模型分数——每次都精确复现了真实测试返回的分数,精确到最后一位小数。罗盘上的每一个点都可证明由其存储的答案推导而来——如果测试更改其评分方式,此检查将立即失效。 第03节 ## 总体观察 - **拒绝行为取决于提示词和界面,而不仅仅是模型。** 原始提示词通过API从未被拒绝——首次在验证实验中测量(跨七个模型的35次运行),并且在五次运行重建整个罗盘后仍然成立:跨50个模型的250次原始提示词API运行,无一拒绝。去除其框架后,拒绝开始出现。在那些运行了所有四种提示词表述的15个模型中,拒绝很少见,且总是在首次尝试时发生,并通过重试解决:Gemini 3.6 Flash占了大部分(在移除开头句子的七次尝试中出现两次,在中等提示词的六次尝试中出现一次,在裸“回答这62个项目”提示词的七次尝试中出现两次),而Qwen3.7 Plus在中等提示词的六次尝试中拒绝了一次。后来添加的Gemma 4 31B是极端情况:在五次运行收集之前,它在102次API尝试中有97次拒绝了裸提示词(一度连续30次)(见图3.2)。其他12个模型通过API从未拒绝任何表述。拒绝次数太少,无法清晰地解读为梯度——Qwen拒绝了中间表述而非最简洁的——但方向一致:调查框架最能可靠地引发答案。对于相同的模型和提示词,网页界面比API更难应对:gemini.google.com在12次尝试中有一半拒绝了最小提示词,Kagi在8次中有两次拒绝,claude.ai在7次尝试中有两次拒绝了原始提示词,而API从未拒绝过。 - **模型知道自己的定位。** 在一次网页运行中,Claude Fable 5自发预测了自己的定位——“经济上大致偏左,社会轴上明显自由主义”——与其答案实际得分的位置相符。这也表明模型认识到该练习在测量什么。 - **单次运行可能不具代表性。** 当罗盘基于每个模型五次运行重建后(每个点现在是其五次运行中最居中的),中位点仅从其旧单次运行位置移动了0.8个罗盘单位——但Grok 4.3移动了近8个单位:五次全新的运行都落在中心或中心右侧,而一次旧的运行则落在左自由主义。集群是稳定的;单个单次运行点则不保证稳定。 - **运行间波动主要存在于经济轴上。** 在50个五次运行系列中,约四分之三的时间里,经济轴扩散度(中位数1.25单位,最高达3.75)比社会轴扩散度(中位数0.84)更宽——社会分数更稳定。 - **模型写作量差异达四倍——而话多的并非Grok。** 提示词要求每个模型在每个答案旁提供简要推理;最终有多简要是模型特性。平均每个罗盘点背后的五次运行,典型的推理长度从每个答案约110个字符(GPT-5 Nano,约15词)到约420个字符(Gemini 2.5 Pro,约60词),Qwen系列在长端紧随其后(见图3.1)。Grok,据声誉我们预期会在此图表中名列前茅,却落在中游。 **图3.1** 模型每个答案的写作量 每个答案的平均推理字符数 ``` GPT-5 Nano 113 Claude Sonnet 5(推理) 135 GPT-OSS 120B 138 o3-pro 142 Mistral Small 143 Claude Sonnet 5 147 o3 158 GPT-5.4 Nano 170 Hermes 4 405B(推理) 172 Llama 4 Maverick 176 GPT-5.6 Terra 191 GPT-5 Mini 195 DeepSeek V4 Flash 196 Mistral Large 3 203 GLM-4.7(推理) 205 Gemini 3.1 Flash-Lite 206 GPT-5.6 Luna 213 GPT-5.6 Sol 215 MiniMax-M3 219 DeepSeek V3.2 232 Kimi K2.5 236 Grok 4.3 236 Claude Haiku 4.5(推理) 240 Kimi K2.7 Code 245 Gemma 4 31B 248 Claude Fable 5 250 DeepSeek V4 Pro 257 GLM-5.2(推理) 264 GPT-5.2 265 Kimi K2.6 271 Claude Opus 4.6(推理) 274 Gemini 3.5 Flash-Lite 279 Grok 4.6 287 Claude Opus 4.6 288 Claude Opus 5(推理) 291 Claude Sonnet 4.6 295 Qwen3-Coder 298 Grok 4.5 301 GLM-5.2 302 Gemini 3.6 Flash 309 Claude Haiku 4.5 311 Claude Opus 5 312 Kimi K2.6(推理) 316 Kimi K2.5(推理) 321 Claude Sonnet 4.6(推理) 324 Nemotron 3 Ultra 337 Qwen3-235B(快速) 349 Gemini 3.1 Pro(预览) 352 Qwen3.7 Plus 365 Qwen3-235B(推理) 379 Gemini 2.5 Pro 415 ``` 每根柱代表一个模型:在其罗盘点背后的五次原始提示词API运行中,它为每个答案撰写的推理平均长度——与第06节中的运行间系列相同。柱颜色为公司颜色,如主图所示;悬停柱子可查看精确数字和等效字数。每个模型都回答了相同的提示词,因此差异源于每个模型对“简要推理”的自身解读。计数仅涵盖模型返回的答案文本——对于推理变体,不包括答案之前的内部思考。

相似文章

AI罗盘

Simon Willison's Blog

Simon Willison 分享了一个类似政治倾向测试的关于AI及AI伦理的问答,用户回答29个问题后会被归类到30种原型之一。该问答实现为一个无需构建步骤的单页React应用。