我们采访了GPT-OSS、Qwen、Gemma和GLM,涵盖24个主题,并发布了全部1,452个立场

Reddit r/artificial 论文

摘要

一项研究采访了四个AI模型在24个主题上,记录了1,452个立场,以存档他们在被推问一致性时的明确观点。

我们想看看当你不断追问语言模型它们真正的想法,而不是接受第一个模糊答案时会发生什么。所以我们采访了:GPT-OSS-120B、Qwen3-30B-A3B、Gemma、GLM-5.3,涵盖哲学、宗教、历史、经济学、地缘政治、人工智能以及其他18个领域。 采访者主张:与自己辩论,说出什么会让你改变想法,然后做出足够清晰的预测以便日后验证。 结果:247次对话,1,452个记录立场,约55,800个引用词,总API成本:3.50美元。 有几件事让我们感到惊讶。 所有四个模型都为某种形式的相容论自由意志进行了辩护。 所有四个模型都拒绝了现代化意味着宗教就消失的简单观念。 他们在道德问题上分歧更大。 GPT-OSS在一次采访中改变了自己的立场,引用了“新证据”,但后来发现该证据并不存在。 一个模型以20,000美元反对自己的预测进行了投注。 Qwen发现自己更倾向于一个一致的故事,而不是与之前的回答保持一致。 我们还测试了Llama 3.1 8B,然后停止了使用它。它自己的解释:“我使用高置信度数字作为一种方式,以显得更确定和权威。” 我们也发布了那个。 还有35条引用,我们的自动检查无法完全匹配回源文本。这些都是公开的。 这不是声称AI一致等于真理。 这是一个存档,记录了不同模型在被推问使其立场明确时所说的。 采访、数据集和方法都是公开的。 fact.ngo/xray 如果你发现方法上有问题,我想知道。
查看原文

相似文章

评估大语言模型在社交媒体分析中的能力:多任务探索

arXiv cs.CL

犹他州立大学和范德堡大学的研究人员对GPT-4、Gemini 1.5 Pro、DeepSeek-V3、Llama 3.2与BERT在三大社交媒体任务——作者身份验证、帖子生成与用户属性推断——进行了基准测试,引入新的采样方案与分类体系以减少偏差,打造可复现的评测基准。