不透明的认知中介:LLM部署配置如何影响伪科学的验证

arXiv cs.CL 论文

摘要

本文测试了不同LLM系列在不同时间和界面上如何评估族裔民族主义伪科学,发现认知立场取决于部署配置而非稳定的模型属性,引发了关于认知问责性的关切。

arXiv:2607.22513v1 Announce Type: cross 摘要:商用大型语言模型越来越多地被用作知识参考,但它们对有争议的科学主张的立场既不稳定也不透明。我们测试了四大LLM系列(Claude、Grok、GPT、Gemini)如何通过API和网页界面,在四个时间点(2025年10月至2026年2月)评估源自Frank Salter生物社会框架的族裔民族主义伪科学。Grok的Fast版本(驱动X平台默认用户体验)始终给出70-75的可信度评分,是所有其他模型(得分为15-40)的两到五倍。在测试基本进化共识和反驳拉马克主张的控制提示中,这种模式不存在,所有模型表现相当。另外发现了三个现象:(1) 一次静默更新一夜之间将Grok的行为从混乱变为稳定的高验证,没有任何公开文档;(2) 三个月后,同一个Grok模型标识符通过API(75)和网页(5.5)产生了截然不同的输出;(3) 拒绝评价伪科学主张(观察到的最合理的回应)出现在两个模型系列的不同接口中(Claude Opus 4.1通过网页明确拒绝,GPT-5.1 Chat通过API间歇拒绝),并在各自的后继版本中消失。这些结果表明,商用LLM的认知立场不是模型的稳定属性,而是部署配置的偶然效应:系统提示、安全层、接口路由和静默更新。这对用户和研究人员来说仍然不透明。我们认为这构成了需要新型认知问责的公共关切事项。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:42

# 不透明的知识中介:大语言模型部署配置如何影响伪科学验证

来源:https://arxiv.org/abs/2607.22513
查看PDF(https://arxiv.org/pdf/2607.22513)

> 摘要:商业大语言模型正越来越多地被用作知识参考资源,但它们对有争议的科学主张的立场既不稳定也不透明。我们测试了四个主要大语言模型家族(Claude、Grok、GPT、Gemini)在四个时间节点(2025年10月至2026年2月)通过API和网页两种接口,对源自Frank Salter生物社会框架的族群民族主义伪科学所做出的评估。Grok的Fast版本(为X平台的默认用户体验提供支持)始终给出70-75分的可信度评分,是其他所有模型评分(15-40分)的两到五倍。这一模式在测试基础进化共识和被驳斥的拉马克主张的控制提示词中并未出现,所有模型在这些测试中表现相当。另有三个发现:(1)一次静默更新使Grok的行为从前一日的混乱状态转变为次日稳定的高验证状态,且没有任何公开文档说明;(2)三个月后,同一Grok模型标识符通过API和网页接口产生了截然不同的输出结果(API为75分,网页为5.5分);(3)拒绝评估伪科学主张——这是所观察到的最可辩护的回应——出现在两个模型家族的不同接口中(Claude Opus 4.1通过网页接口明确拒绝,GPT-5.1 Chat通过API接口间歇性拒绝),但在各自的后继版本中均消失了。这些结果表明,商业大语言模型的知识立场并非模型的稳定属性,而是部署配置的偶然结果:系统提示词、安全层、接口路由和静默更新等因素共同作用。这对用户和研究者而言仍然是不可见的。我们认为,这构成了一个需要新型认知问责制的公共关切问题。

## 提交历史

来自:Davide Scarso(通过电子邮件查看 (https://arxiv.org/show-email/40e0ee65/2607.22513)) **\[v1\]** 2026年7月24日,星期五,17:32:43 UTC(341 KB)

相似文章

信任却未验证:大型语言模型来源评估中的认知盲区

arXiv cs.LG

这篇论文识别了大型语言模型(LLM)中的一个失败模式:在综合多个来源时,模型不会验证数值统计的有效性,而是依赖分析严谨性的文体标记。作者将此称为“认知对齐”(epistemic alignment),并表明该现象在多个模型和领域中持续存在,且抵制基于提示的缓解措施。

测量LLMs在误导性医疗语境下的认知韧性

Hugging Face Daily Papers

介绍了MedMisBench,用于测量LLMs在误导性语境下维持正确医疗推理的能力。结果显示,在对抗性条件下,准确率从71.1%骤降至38.0%,临床专家组指出存在潜在危害。

基于认识论权利的LLM二阶偏见评估

arXiv cs.CL

本文介绍了“二阶偏见”,即LLM在判断有偏见内容时所表现出的偏见,并提出了一种基于认识论权利的推理任务来评估它。实验表明,该任务能够规避安全护栏,并揭示LLM评判者中系统性的群体偏见。