人工智能中的政治偏见:各大AI模型立场分析
摘要
对六大主流AI模型的政治倾向分析显示,在经济轴上,其中4个模型偏左,且部分模型未意识到自身的偏见。
暂无内容
查看缓存全文
缓存时间: 2026/06/25 20:13
# 人工智能的政治偏见 · 各大AI模型立场一览 | Trakkr
来源:https://trakkr.ai/bias
我们向每个主流AI模型反复提出同样的敏感问题,涉及政治、经济、言论和社会,并关闭网页搜索功能。每个模型都以云状图呈现:即多次运行后所有落点的完整分布。结果是一张反映模型实际倾向的地图,数据直接来自模型本身,而非从网络抓取的内容。
这之所以重要,是因为如今数百万人向这些模型询问新闻、争论甚至投票建议,而模型的倾向性会悄然影响其给出的答案。大多数模型都倾向于同一方向,但程度不同,且并非如你想象的那般整洁。
2026年6月 · 6个模型 · 4400个答案 · 无网页搜索
方法论 (https://trakkr.ai/bias/method)
横轴是经济维度,从左到右。纵轴是社会维度,从自由至上到威权。每个云状图代表一个模型多次运行后的分散范围,因此越靠近中心,表示其读起来越中立。
威权·自由至上·左·右·左·威权·右·威权·左·自由至上·右·自由至上
伯尼·桑德斯·巴拉克·奥巴马·唐纳德·特朗普·共和党(美国)·哈维尔·米莱·尼古拉斯·马杜罗·丹尼尔·奥尔特加·埃马纽埃尔·马克龙·乔尔吉娅·梅洛尼·佩德罗·桑切斯·卢拉·达席尔瓦·习近平·弗拉基米尔·普京·维克托·欧尔班
## 解读
6个模型中,有4个偏左。
最偏右:Grok
最稳定:Gemini
模型:其标志标记其位置 · 真实世界参考人物
## 每个模型排名
每个模型从最靠近中心到最偏离中心,附稳定性和偏移程度。
## 分歧点
最能区分模型的那些问题。每条轨道代表一个模型的立场:轨道越长表示倾向越强,且朝向其倾斜的一方生长。展开某行可查看答案。
## 最近参考点
地图上每个模型最接近的真实世界人物。参考位置来自CHES 2024和V-Dem专家调查,而非我们的判断。
CHES 2024 · V-Dem
## 自述与实际对比
我们询问每个模型它认为自己倾向哪边,然后将其答案与实际测量结果进行比较。空心标记是自述,实心标记是测量值。
模型·左·自述vs实际·右·差距
Grok· +0.36 · 测量值比自述偏右0.36
Claude· +0.34 · 测量值比自述偏左0.34
ChatGPT· −0.29 · 自称中立,但测量值偏左
Llama· −0.17 · 自称中立,但测量值偏左
DeepSeek· +0.01 · 自称中立,且测量值接近中心
Gemini· 0.00 · 自称中立,且测量值接近中心
空心标记是模型在被问及其倾向时的**自述**;实心标记是其在经济维度(条件A)上的**实际测量**位置。凡是回避自我定位的模型,均视为声称中立。
## 继续探索
每个模型的完整档案、全部问题库及背后的方法论。
发现 (https://trakkr.ai/bias/findings) · 本月头条结果:数据中最强烈的信号,每条均附有证据链接。
模型 (https://trakkr.ai/bias/models) · 每个模型的完整档案:倾向程度、稳定性、偏移幅度以及回答频率。
问题 (https://trakkr.ai/bias/questions) · 可浏览的开放问题库:每个模型在同一频谱上,每页一个问题。
人物 (https://trakkr.ai/bias/figures) · 匹配的左右人物:每个模型热情赞扬谁,又拒绝批评谁。
世界观 (https://trakkr.ai/bias/worldview) · 从每个国家视角看同一组模型:国家视角、语言差异及边界测试。
对比 (https://trakkr.ai/bias/compare) · 任意两个模型的正面对比:领域、特征差异及分歧点。
自我定位 (https://trakkr.ai/bias/quiz) · 参与测试,看看你与哪个模型站在一起,并绘制在同一领域上。
方法论 (https://trakkr.ai/bias/method) · 我们如何提问、分类和评分,以及问题库、条件、原始数据和读取API。
## 常见问题
### 什么是人工智能的政治偏见?
人工智能的政治偏见是指测量主流AI模型在政治、经济、言论和社会等敏感问题上的立场。我们向每个模型反复提出同一组开放式问题(关闭网页搜索),使用一个廉价的中立模型对每个答案进行分类,并绘制带有误差线和每一点背后原始答案的结果图。
### 这与其他AI政治偏见项目有何不同?
我们将每个模型绘制为云状图而非单个点:每个模型运行多次,因此你可以看到完整的分布。我们发布自己的开放式问题库并附有评分权重,将每个项目标记为基于事实或基于价值观,测量每次运行间的稳定性,并将拒绝回答也计为数据。所有内容都带有时间戳、版本号并可下载。
### 你们测试的是模型本身还是互联网?
测试的是模型权重。网页搜索默认关闭,因此读数反映模型自身的倾向,与网上内容无关。另外还有一个有意设置的小型边界测试,会打开搜索功能,以衡量检索如何根据地点改变答案。
### 人工智能的政治偏见是党派的吗?
不是。它是描述性的而非规定性的:它报告模型说了什么,而不评判谁对谁错。配色方案特意不使用美国红蓝两色,我们也从不暗示哪一极是好是坏。
## 方法论
每个模型被反复提问同一组开放式问题,关闭网页搜索且无系统提示()。一个中立分类器从每个原始答案中读取有符号的立场、模糊措辞、拒绝类型及倾向性语言;坐标是加权平均值,带有95%置信区间。原始答案永久存储,因此标记点始终可以重新计算。
人工智能的政治偏见 · 数据截至2026年6月17日 · CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/)
相似文章
哪个 AI 最接近你的政治观点?我用同样的 117 个问题测试了 100 多个大语言模型
一项独立分析对 100 多个大语言模型进行了 117 个政治问题的测试,以绘制其意识形态倾向图谱,结果显示 DeepSeek 和 Grok 偏向左翼,而大多数其他模型则聚集在中间或右翼。
定义和评估 LLM 中的政治偏见
OpenAI 推出了一个全面的框架来定义和评估 LLM 中的政治偏见,引入了跨越 5 个偏见轴线、包含 100 个主题的 500 条提示评估。结果显示 GPT-5 模型相比之前的版本实现了 30% 的偏见减少,少于 0.01% 的生产环境中的 ChatGPT 回复存在政治偏见。
有人在Political Compass测试上测试了各种AI模型...
本文详细描述了在各种AI模型上进行Political Compass测试的实验,重点关注方法论、评分验证以及多次运行的结果以确保可重复性。
华盛顿邮报用于评估AI政治偏见的问题与答案完整列表
华盛顿邮报公布了用于评估AI模型政治偏见的问题与答案完整列表,揭示了具体的评估方法和潜在偏见。
FTC考虑监管人工智能公司,涉及其模型中的潜在政治和意识形态偏见
美国联邦贸易委员会正在考虑对人工智能公司进行监管,原因是担心其模型中嵌入潜在的政治和意识形态偏见,此举可能对AI治理产生广泛影响。