我们采访了GPT-OSS、Qwen、Gemma和GLM,涵盖24个主题,并发布了全部1,452个立场
摘要
一项研究采访了四个AI模型在24个主题上,记录了1,452个立场,以存档他们在被推问一致性时的明确观点。
我们想看看当你不断追问语言模型它们真正的想法,而不是接受第一个模糊答案时会发生什么。所以我们采访了:GPT-OSS-120B、Qwen3-30B-A3B、Gemma、GLM-5.3,涵盖哲学、宗教、历史、经济学、地缘政治、人工智能以及其他18个领域。
采访者主张:与自己辩论,说出什么会让你改变想法,然后做出足够清晰的预测以便日后验证。
结果:247次对话,1,452个记录立场,约55,800个引用词,总API成本:3.50美元。
有几件事让我们感到惊讶。
所有四个模型都为某种形式的相容论自由意志进行了辩护。
所有四个模型都拒绝了现代化意味着宗教就消失的简单观念。
他们在道德问题上分歧更大。
GPT-OSS在一次采访中改变了自己的立场,引用了“新证据”,但后来发现该证据并不存在。
一个模型以20,000美元反对自己的预测进行了投注。
Qwen发现自己更倾向于一个一致的故事,而不是与之前的回答保持一致。
我们还测试了Llama 3.1 8B,然后停止了使用它。它自己的解释:“我使用高置信度数字作为一种方式,以显得更确定和权威。”
我们也发布了那个。
还有35条引用,我们的自动检查无法完全匹配回源文本。这些都是公开的。
这不是声称AI一致等于真理。
这是一个存档,记录了不同模型在被推问使其立场明确时所说的。
采访、数据集和方法都是公开的。
fact.ngo/xray
如果你发现方法上有问题,我想知道。
相似文章
@GergelyOrosz:每次有新模型,我都会用它来做写作测试——看看它是否能像我一样工作——我给它一堆我做的采访……
Gergely Orosz 测试新AI模型(如Fable和GPT-6),要求它们根据他的采访写出他风格的文章,但发现它们彻底失败,写了很多字却没有理解。
我测试了6款AI面试助手,并将结果整理成公开数据集
一位开发者测试了六款AI面试助手产品,发现所有产品均未通过数项行为检查,并发布了一个包含6款产品、11项标准、共66项评估的公开数据集,可在GitHub和Zenodo上获取。
评估大语言模型在社交媒体分析中的能力:多任务探索
犹他州立大学和范德堡大学的研究人员对GPT-4、Gemini 1.5 Pro、DeepSeek-V3、Llama 3.2与BERT在三大社交媒体任务——作者身份验证、帖子生成与用户属性推断——进行了基准测试,引入新的采样方案与分类体系以减少偏差,打造可复现的评测基准。
发现一个工具,同时向GPT、Claude、Gemini和Grok提问,并给出一个共识答案
文章介绍了AllChat这个工具,它能同时查询GPT、Claude、Gemini和Grok,并返回一个共识答案,同时列出每个模型的回答概要。
评估了6个前沿LLMs(GPT-5.4、Claude Sonnet 4.6、Claude Opus 4.7、Gemini Pro/Flash、Grok 4.3)在政治、性别和种族偏见方面的表现,跨越8个基准测试(约20,600个示例)[R]
一项对6个前沿LLMs在8个偏见基准测试上的独立评估发现,大多数模型在政治上偏左,并且Grok自述的右倾立场与其左倾行为不一致。拒答率各不相同,GPT-5.4在20%的种族相关问题上拒绝回答。