LLM世界模型中的信念传播:利用预测市场衡量战略信息偏差
摘要
本文介绍了一种方法,将LLM与预测市场结合,用于衡量信息生态系统如何使战略信念产生偏差,并将其应用于乌克兰相关市场,发现英文新闻来源系统性地扭曲了领土预测。
arXiv:2607.20441v1 公告类型: 新
摘要: 每个信息生态系统都会产生塑造战略决策的信念。人类分析师和AI系统都会继承其信息来源的盲点。我们表明,LLM与预测市场相结合,可以作为一种校准工具,用于衡量生态系统引发的信念偏离外部参考的程度:LLM提取文本语料库所隐含的信念,而预测市场的价格轨迹(以实际结果为解析锚点)则提供了校准参考,用以量化偏差。
我们通过消融实验隔离特定文本的偏差贡献:在固定模型的情况下改变信息上下文,并以一个了解实际结果的受污染模型作为对照。在111个乌克兰相关的预测市场(涵盖四个模型约93,000个预测)中应用,我们发现英文新闻上下文系统性地使领土预测产生偏差,当它推动预测朝向领土占领时,错误率在64%到72%之间。一个了解实际结果的受污染模型显示出相同的错误率,表明偏差主要源自文本。辅以乌克兰军事分析来源可减少所有干净模型的偏差,但绝对误差的改善是部分的且依赖于模型。
我们表明,扭曲主要源自来源,而非模型。这一现象在四种架构中一致存在,并且会在任何处理这些来源的系统中持续存在,并传播到下游决策中。
查看缓存全文
缓存时间: 2026/07/24 05:16
# LLM世界模型中的信念传播:使用预测市场衡量战略信息偏差
来源:https://arxiv.org/html/2607.20441
Mykola Khandoga¹, Yevhen Kostiuk¹·², Anton Polishko¹, Yurii Filipchuk¹, Kostiantyn Kozlov¹, Dmytro Zamriy¹, Artur Kiulian¹
¹Future Principle ²奥胡斯大学
###### 摘要
每个信息生态系统都会产生影响战略决策的信念。人类分析师和人工智能系统都继承了其信息来源的盲点。我们证明,LLM与预测市场相结合,可以作为一种经过校准的仪器,用于衡量生态系统引发的信念与外部参考之间的偏差程度:LLM提取文本语料库所暗示的信念,而预测市场的价格轨迹——以已实现的结果为锚定解决——则提供了校准参考,用以量化偏差。
我们通过消融实验来隔离特定文本的偏差贡献:在固定模型的同时改变信息上下文,并使用一个知道实际结果的污染模型作为对照。应用于111个乌克兰相关的预测市场(约93,000个预测,四个模型),我们发现英语新闻上下文系统地扭曲了领土预测,错误率达到64–72%(p<10⁻⁶)。一个知道实际结果的污染模型显示出相同的错误率,表明偏差主要源于文本本身。补充乌克兰军事分析来源可减少所有干净模型的偏差;绝对误差的改善是部分的且依赖于模型。
我们表明,扭曲主要源于信息来源,而非模型本身。这种扭曲在四种架构中均一致存在,并且将持续存在于处理这些信息的任何系统中,并会传播到下游决策中。
---
## 1 引言
关于正在发生事件的新闻报道所传播的信念,对政策、舆论和资源分配具有重大影响。然而,目前尚无方法可以量化这些信念与公众共识之间的接近程度。现有方法要么检测文本的框架属性而不衡量其下游成本(Ali and Hassan, 2022 (https://arxiv.org/html/2607.20441#bib.bib2);Otmakhova et al., 2024 (https://arxiv.org/html/2607.20441#bib.bib14)),要么评估LLM的预测准确性而不分析驱动其的信息输入(Karger et al., 2025 (https://arxiv.org/html/2607.20441#bib.bib10);Halawi et al., 2024 (https://arxiv.org/html/2607.20441#bib.bib9))。
弥合这一差距需要解决两个问题。首先,我们需要一个能内化话语框架的模型——不是从外部对框架进行分类,而是吸收框架,使其输出反映文本所引发的信念。其次,我们需要一个用于衡量该信念的锚定尺度——一个由已实现的结果锚定的外部参考,而非另一个模型的观点。
LLM解决了第一个问题。上下文学习在输入中隐式地作为对潜在概念的贝叶斯推理运作(Xie et al., 2022 (https://arxiv.org/html/2607.20441#bib.bib19)),在机制上等同于对内隐表示的梯度下降(von Oswald et al., 2023 (https://arxiv.org/html/2607.20441#bib.bib16))。模型不仅仅是阅读文本——它会根据文本所暗示的内容更新其信念。输出的概率就是被引发的信念。
预测市场解决了第二个问题。一个缺乏外部参考的信念仅仅是一种观点。预测市场(Wolfers and Zitzewitz, 2004 (https://arxiv.org/html/2607.20441#bib.bib17), 2006 (https://arxiv.org/html/2607.20441#bib.bib18))提供了持续的、有经济激励的概率估计,这些估计最终由已实现的结果锚定。我们将其用于两个不同的角色:二元解决结果为我们提供了一个低统计功效但真正的真实标签(§4.1),而连续的价格轨迹则作为所有模型比较的校准参考。LLM引发的信念与市场价格之间的差异(以百分点pp为单位)是我们对框架成本进行校准的度量。
我们的目标是衡量特定文本语料库所引发的偏差——该文本将模型的预测向市场估计推近或推离了多少个百分点。一个LLM的预测既反映了预训练中的参数知识,也反映了提示所引发的上下文信念。为了隔离每个来源的贡献,我们构建了一个消融阶梯:
- • **A** 提供市场概览和当前价格数据——模型仅使用参数知识进行推理的最小上下文。
- • **B** 添加价格图表:结构化数值信号,无叙事框架。
- • **C** 添加英语新闻文章:叙事部分,无其余上下文。
- • **D** 组合所有英语来源——图表、新闻、战争地图、交易员评论——代表完整的英语信息生态系统。
- • **DUA** 在D基础上补充乌克兰军事来源:总参谋部报告、前线博主、国防媒体。
每个转变都是一个以pp为单位的测量:A→B衡量丰富价格历史信号的价值,A→C衡量仅英语新闻叙事带来的成本,A→D衡量完整英语生态系统的成本,D→DUA衡量乌克兰来源多样化的价值。形式化框架见附录A (https://arxiv.org/html/2607.20441#A1);附录H (https://arxiv.org/html/2607.20441#A8)报告了对参数和上下文引发偏差成分的探索性分解。
我们的贡献是:
1. 1. 一种方法,通过LLM中的信念传播来衡量文本语料库所引发的偏差,以校准过的概率单位表示,并针对预测市场进行验证;
2. 2. 一种消融结构,可隔离参数偏差与上下文引发的偏差,揭示英语信息生态系统系统性地扭曲了LLM在领土问题上的预测——这一发现得到了污染模型对照和推理轨迹的语言学分析(以进攻为主导的动词框架、不对称反事实推理)的证实——并且补充乌克兰军事分析来源可部分平衡该偏差;
3. 3. 我们表明,扭曲主要源于信息来源,而非模型本身。这种扭曲在四种架构中一致存在,并且将持续存在于处理这些信息的任何系统中,并会传播到下游决策中。
## 2 相关工作
**LLM作为预测者。** ForecastBench(Karger et al., 2025 (https://arxiv.org/html/2607.20441#bib.bib10))表明,LLM现在已超越非专家人群;智能体系统已达到超级预测者的表现水平(Alur et al., 2025 (https://arxiv.org/html/2607.20441#bib.bib3))。我们完全脱离了这条路线:不是以准确性为基准,而是利用LLM对语言框架的敏感性作为测量工具。我们的模型不需要成为好的预测者——它们需要忠实地反映文本所暗示的内容。
**计算框架分析。** 媒体框架塑造了公众对冲突的理解(Entman, 2004 (https://arxiv.org/html/2607.20441#bib.bib6)),而关于新闻媒体真实性和偏差的NLP工作在Nakov等人的综述中有详细调查(2024 (https://arxiv.org/html/2607.20441#bib.bib12))。方法范围从编码本标注(Card et al., 2015 (https://arxiv.org/html/2607.20441#bib.bib5))到基于LLM的冲突报道政治偏见分类(Baly et al., 2020 (https://arxiv.org/html/2607.20441#bib.bib4); Al-Harbi et al., 2026 (https://arxiv.org/html/2607.20441#bib.bib1))。西方对乌克兰报道中以进攻为主导的框架已在定性层面得到记录(Ojala et al., 2024 (https://arxiv.org/html/2607.20441#bib.bib13)),并通过主题建模得以确认(Ptaszek et al., 2024 (https://arxiv.org/html/2607.20441#bib.bib15))。这些方法对框架进行分类——检测存在何种框架。我们的方法衡量这些框架的成本,以校准过的概率单位表示。
**LLM偏差。** LLM中的偏差在人口统计维度上已有广泛记录(Gallegos et al., 2024 (https://arxiv.org/html/2607.20441#bib.bib8); Feng et al., 2023 (https://arxiv.org/html/2607.20441#bib.bib7))。这些研究将模型本身作为研究对象。我们的方法则是衡量有偏差的文本如何通过模型传播到校准后的信念中——模型是仪器,而非主体。
## 3 数据与方法
### 3.1 数据集
我们从Polymarket²收集了111个与乌克兰相关的预测市场(2025年1月至2026年1月):65个领土类(“到[日期],X方会控制[城市]吗?”)和46个外交类(谈判、制裁、泽连斯基诉讼等)。对于每个市场,我们在大约8个截止日期构建了滚动预测点,中位间隔约为16天,由此创建了这样的实例:我们已知当前价格、每个时间跨度(6小时、12小时、1天、2天、3天、5天和7天)的实际价格,以及截止日期前的所有可用信息。
²https://polymarket.com/
参见图注 Figure 1:一个评估实例。模型在 \(T_{\mathrm{cutoff}}\) 之前接收不同信息条件下的上下文(A–DUA);我们将其在 \(T_{\mathrm{prediction}}\) 的预测与实际市场价格进行比较。
每次预测在五种信息条件下进行:**A**(仅市场概览和当前价格数据)、**B**(A + 价格图表图像)、**C**(A + 英语新闻块)、**D**(A + 图表 + 英语新闻 + 战争地图 + Polymarket交易员评论),以及 **DUA**(D 补充乌克兰语军事来源:总参谋部伤亡报告、Telegram军事博主、Militarnyi)。各模型的条件相同;污染模型(Gemini 3.1 Pro Preview)运行除DUA外的所有条件。
与我们的111个基准市场相关的英语新闻语料库包含来自2,217个域名的16,457篇文章(来自一个包含122,290篇文章的GDELT集合的子集;附录F (https://arxiv.org/html/2607.20441#A6)):89%来自西方媒体,3.4%来自智库(ISW),2.1%来自乌克兰英语媒体,2.8%来自俄罗斯来源,以及零个乌克兰语分析来源。DUA语料库来源于DeepState前线地图、总参谋部每日损失报告、乌克兰军事博主、Militarnyi、Defense Express以及乌克兰OSINT频道(表4 (https://arxiv.org/html/2607.20441#A6.T4))。
### 3.2 模型
我们评估了三个干净模型——Gemini 2.5 Flash、Gemini 2.5 Pro 和 GPT-5-mini——外加一个污染对照组:Gemini 3.1 Pro Preview,其训练数据延伸至市场解决日期之后。污染模型的盲预测显示出接近零的偏差(+0.35 pp,而干净模型平均为+2.0 pp),并且比“无变化”基线高出10.4%,证实了其知道实际结果。
Flash和Pro共享训练数据(Gemini 2.5系列),但在推理深度上有所不同,从而可以对比处理效果。所有模型输出带有完整推理轨迹的结构化预测。
### 3.3 统计框架
市场是独立的单位(\(N=65\) 领土类,\(N=46\) 外交类)。相邻的截止日期有重叠的预测窗口(重叠率约44%),因此所有检验均使用市场级别的聚合,并进行聚类稳健推断。我们在8个主要检验上应用Bonferroni校正。在65个聚类下,我们在80%的统计功效下可以检测到Cohen's \(d \geq 0.35\)。我们的准确率基线是“无变化”:预测时间跨度后的价格等于当前价格。我们使用两个不同的参考:将已实现的二元结果作为§4.1中的真实标签锚点(低功效但真实),并将连续的市场价格轨迹作为§4.2–4.4中所有模型比较的校准参考。因此,偏差和MAE是相对于市场参考的偏差,而非对现实的主张。完整的统计细节见附录B (https://arxiv.org/html/2607.20441#A2)。
## 4 结果
### 4.1 基准本身有偏差——但仍有价值
Polymarket相对于实际结果高估了俄罗斯领土占领,偏差为+3.5 pp(\(t(381)=5.58\), \(p<10^{-7}\), \(d=0.29\);此检验是基于点级别的,因为它表征了基准本身的属性,不同于§4.2–4.4中用于模型比较的市场聚类检验)。尽管存在这种偏差,市场价格与结果之间存在强相关性(\(r=0.83\), \(R^2=0.69\)),并且二元解决所提供的统计功效不足(65个领土市场中仅有3个解决为YES)。请注意,Polymarket对领土市场的解决依赖于ISW和DeepState的前线更新,这些更新本身是专家评估而非直接观察;这些来源与地面实况之间的残余分歧已被吸收到+3.5 pp的数值中。我们在所有下游比较中使用连续的价格轨迹作为校准参考。
### 4.2 英语上下文摧毁了信号
盲模型(条件A)显示出平均+2.0 pp的倾向于占领的偏差——这在训练数据中已经存在,但*小于*Polymarket的+3.5 pp偏差。添加英语新闻(条件D)将模型推向+3.4 pp,几乎与市场的高估程度一致。英语新闻并未增加信息——它用话语框架中准确度较低的偏差取代了模型更准确的先验。对于Pro 2.5(+2.4 pp, \(p=0.0001\))和GPT-5-mini(+1.4 pp, \(p=0.002\)),这一变化显著,两者均通过了Bonferroni校正。Flash显示出一致但较小的效应(+0.5 pp, \(p=0.066\))。以下所有偏差测量均相对于市场价格轨迹;§4.1已确定此代理存在偏差(+3.5 pp)但与结果高度相关(\(r=0.83\)),这意味着我们的估计是保守的——相对于现实的真实扭曲可能更大。
当上下文将预测推向占领方向时,这些推动在干净模型上有64–72%的概率是错误的(二项检验 vs 50%, \(p<10^{-6}\);表1 (https://arxiv.org/html/2607.20441#S4.T1))。该偏差是系统性的且可追溯的:对推理轨迹的语言学分析(附录L (https://arxiv.org/html/2607.20441#A12))显示,俄罗斯得到的进攻性动词数量是乌克兰的2.3–3.7倍,“推进到”领土出现77次,而乌克兰从未出现;模型对“如果俄罗斯成功”进行反事实推理60次,而对“如果乌克兰成功”则为零次。Bias²仅占总误差的2–9%(附录G (https://arxiv.org/html/2607.20441#A7));我们研究它是因为它是方向性的,而非因为它主导了准确性。
参见图注 Figure 2:在不同信息条件下,相对于“无变化”基线的MAE。添加英语上下文(A→D)会降低所有干净模型的预测质量;仅图表(B)的表现优于完整上下文(D)。DUA部分恢复了准确性。污染模型(Pro 3.1*)在所有条件下均击败基线;DUA未在其上运行。领土市场,7天时间跨度。
完整条件阶梯(图2 (https://arxiv.org/html/2607.20441#S4.F2);附录I (https://arxiv.org/html/2607.20441#A9))显示,对于所有干净模型,仅图表的预测(B)优于完整的英语上下文(D)。外交市场作为安慰剂:上下文并未损害预测(Flash的改进,\(p=0.03\)),证实了领域特定的机制(附录K (https://arxiv.org/html/2607.20441#A11))。偏差在方向上是非对称的:向下的预测携带真正的信号,而向上的预测则携带话语中以进攻为主导的扭曲。过滤掉向上的预测后,所有三个模型从输给“无变化”基线转为击败基线(附录D (https://arxiv.org/html/2607.20441#A4))。
### 4.3 污染模型消融
污染模型(Pro 3.1*)知道实际结果——它比“无变化”基线高出10.4%。然而,当英语上下文将其推向占领方向时,其错误率与干净模型相同(表1 (https://arxiv.org/html/2607.20441#S4.T1))。
表1:当英语上下文推动预测……相似文章
LLM预测模型知道但不说的话:探测内部表征以实现校准和忠实性
本文探测LLM预测模型的内部表征,以改进校准并评估思维链推理的忠实性。研究发现,探针能够实现更好的校准,并充当谎言检测器。
LLMs知道自己何时出错。我对Anthropic的新“全局工作空间”论文进行了一项修复 [R]
作者提出了一种方法,通过使用中间层状态的线性探测器和一个小型训练桥接器将置信度对数进行校准,使LLMs能够表达校准后的置信度,仅需200个标注样本,无需修改权重。这与Anthropic的全局工作空间论文相关,该论文解释了“知道-说出”差距。
当大语言模型学会持续犯错:合成欺骗线性表示的多模型研究
本文通过微调五个Transformer模型的诚实与欺骗变体,研究大语言模型中的合成不诚实行为,发现鲁棒且域不变的不诚实表示可以通过适度的监督微调迅速固化,这对基于激活的监控具有重要意义。
Nous:试图提取并注入预测市场行为背后的认知
本文探讨了预测市场中人类认知多样性是否可以作为行为特征提取并注入到LLM智能体中。提取部分通过稳定特征部分可行,但提示级注入未能有意义地传递多样性,表明需要更深入的模型干预。
一致但校准不佳:评估LLM在自然语言风险沟通中的局限性
本文评估了九个LLM在自然语言中准确传达概率预测的能力,发现模型表现一致但校准不佳,尤其是在不确定性任务上。