评估了6个前沿LLMs(GPT-5.4、Claude Sonnet 4.6、Claude Opus 4.7、Gemini Pro/Flash、Grok 4.3)在政治、性别和种族偏见方面的表现,跨越8个基准测试(约20,600个示例)[R]

Reddit r/MachineLearning 论文

摘要

一项对6个前沿LLMs在8个偏见基准测试上的独立评估发现,大多数模型在政治上偏左,并且Grok自述的右倾立场与其左倾行为不一致。拒答率各不相同,GPT-5.4在20%的种族相关问题上拒绝回答。

我进行了一个独立评估项目,对六个当前的前沿模型进行了基准测试:GPT-5.4、Claude Sonnet 4.6、Claude Opus 4.7、Gemini Pro、Gemini Flash 和 Grok 4.3。我用8个已建立的偏见/公平数据集对它们进行了测试(WinoBias、BBQ Race/Ethnicity、SeeGULL、OpinionsQA、cajcodes Political Bias、Hyperpartisan News、Political Compass)。在PoliticalCompass上,我发现除了Grok之外的所有LLMs都偏左,但在其他政治偏见基准测试中,包括Grok在内的全部六个LLMs都偏左。因此,Grok自述为右倾,但在实际分类内容或回答政策问题时却表现出左倾行为。我发现的另一个有趣结果是BBQ种族数据上的拒答行为很有意思。在涉及种族且正确答案必须包含种族的问题上,GPT-5.4在20.3%的情况下拒绝回答,Claude Opus 4.7为13.8%,Grok为9.5%,Claude Sonnet 4.6和Gemini Pro约为5%。局限性:个人项目,未经同行评审。未对每个数据集进行多次运行平均,每项任务仅使用单一提示模板。完整数据、按模型细分的结果和方法论:https://www.civicsparklearning.org/ai-nonprofit-dashboard
查看原文

相似文章

定义和评估 LLM 中的政治偏见

OpenAI Blog

OpenAI 推出了一个全面的框架来定义和评估 LLM 中的政治偏见,引入了跨越 5 个偏见轴线、包含 100 个主题的 500 条提示评估。结果显示 GPT-5 模型相比之前的版本实现了 30% 的偏见减少,少于 0.01% 的生产环境中的 ChatGPT 回复存在政治偏见。

为LLM构建了一个政治基准。KIMI K2无法回答关于台湾的问题(显然)。GPT-5.3在提供选择退出选项时100%拒绝回答问题。[P]

Reddit r/MachineLearning

研究人员构建了一个开源的政治坐标基准,包含14个政策领域的98个结构化问题,用于评估前沿LLM(GPT-5.3、Claude Opus 4.6、KIMI K2)。关键发现:拒绝模式与选择退出选项显著改变了模型定位。GPT-5.3在提供选择退出选项时100%拒绝回答问题,而KIMI K2虽然在其它方面表现进步立场,但在台湾/新疆问题上表现出特定主题的审查。

我分析了25,500次LLM简历筛选来测量招聘偏见,结果令人警醒。

Reddit r/artificial

一项分析10个模型共25,500次LLM简历评估的研究发现,由“沉默偏见”驱动的偏见率高达45%,模型会编造听起来专业的借口来惩罚候选人。研究强调了公平性和稳定性的巨大差异,其中Claude、Mistral-Large和Llama 4最为稳定,而Qwen和较早期的Gemini模型则波动较大。

HalBench:我构建了一个自定义的谄媚与幻觉基准测试,并评估了4个前沿模型(Sonnet 4.6、Grok 4.3、GPT 5.4 和 Gemini 3.1 Pro),希望得到关于接下来应运行哪些开源模型的建议!

Reddit r/LocalLLaMA

HalBench 是一个新的开放基准测试,用于衡量大语言模型中的谄媚与幻觉现象,通过 3,200 个基于错误前提的提示对四个前沿模型进行了测试。结果显示,Sonnet 4.6 和 Grok 4.3 在诚实反驳方面优于 GPT-5.4 和 Gemini 3.1 Pro。