基于格论的无偏规范集合值预言机
摘要
本文提出了一种基于格论的方法来定义无偏规范集合值预言机,这些预言机即使在输出被学习并采取行动后仍能保持自洽,从而解决了AI预测中的表演性问题。
arXiv:2606.26418v1 公告类型:新\n摘要:一个非智能体的“预言机”AI,用于估计未来事件的概率,面临自指问题:一旦其答案被学习并采取行动,它可能改变它被要求报告的概率本身。为响应这一问题,一种支持科学家AI计划的方法是仅提出反事实问题,并按照答案没有影响的方式进行评估。我们观察到,这样的答案在它们被学习的那一刻往往变得无关紧要,恰恰是因为其前提随后变为虚假。因此,我们探索一种自指替代方案,其中预言机报告的不是单一概率,而是一个同时无偏且与学习后果自洽的credal集(信念集)。朴素的自洽要求被过多的集合满足(包括无用的答案$[0,1]$),因此问题在于挑选出一个规范的、非平凡的成员。我们利用闭credal集完全格上的Knaster--Tarski不动点定理,取适当定义的保序算子的最小不动点来实现;一种变体则报告包含每个自洽点估计的最小不动点。我们证明了存在性、自洽性和非空性,表明该结构对于非表演性问题退化为经典点答案,并且对于二元事件,在一种自然的外包因假设下,规范答案是一个区间。该发展纯粹基于格论,并且可以不加修改地从二元事件$B$推广到任意随机变量$X$,其中$P(B\mid A,C)$替换为条件分布$\mathcal{L}(X\mid A,C)$。最后我们提出开放问题,包括区间性质本身是否能在该推广中保留。
查看缓存全文
缓存时间: 2026/06/26 05:12
# 基于格论的无偏典范集值预言机
来源:https://arxiv.org/html/2606.26418
(此版本,欢迎评论!¹¹¹本文由AI助手Claude Opus 4.8协助生成。作者对内容负全部责任。)
###### 摘要
一个非智能体的“预言机”AI,用于估计未来事件的概率,面临一个自指问题:一旦其答案被知晓并据此行动,它可能会改变被询问报告的概率本身。针对*科学家AI*方案,一种回应是只询问*反事实*问题,即假设答案没有影响时进行评估。我们观察到,这种答案一旦被获知,往往会变得无关紧要,恰恰因为其前提此时已不成立。因此,我们探索一种*自指*替代方案:预言机报告的不是单一概率,而是一个同时无偏且与知晓答案的后果自洽的信念集。朴素的自洽性要求使得太多集合(包括无用的答案[0,1])都满足条件,因此问题在于挑出一个典范的、非平凡的成员。我们通过闭信念集的完备格上的Knaster–Tarski不动点定理来实现,取一个恰当定义的保序算子的最小不动点;另一种变体则报告包含所有自洽点估计的最小不动点。我们证明了存在性、自洽性和非空性,表明该构造在非表演性问题上坍缩为经典的点答案,并且对于二元事件,在自然凸包分解假设下,典范答案是一个区间。该发展纯粹基于格论,并且可以直接从二元事件B推广到任意随机变量X,只需将P(B∣A,C)替换为条件分布L(X∣A,C)。最后我们提出了一些开放性问题,包括区间性质是否能在该推广中保留。
## 1引言
缓解高级AI风险的一个反复出现的提议是构建*预测*而非*行动*的系统:非智能体的“预言机”或“科学家AI”,它们回答关于世界的问题,本身没有目标(Bengio等人,2025a;Fornasiere等人,2026;Armstrong和O’Rorke,2018;Bengio等人,2025b)。其希望在于,一个只报告信念的系统无法产生影响世界的工具性驱动力,而这正是目标导向型智能体的危险所在。
然而,这个希望因*表演性*而复杂化。一旦预言机的输出被读取并据此行动,该输出就成为它所描述事件的原因;而一个根据实际结果进行训练或评分的预测器,原则上可以通过发布自我实现而非仅仅准确的预测来降低损失。这一现象由来已久:公开预测可以自我验证或自我否定,这曾是关于社会事件可预测性辩论的核心(Morgenstern,1928;Merton,1948;Grunberg和Modigliani,1954;Simon,1954;Popper,1957),并以表演性预测理论(Perdomo等人,2020;Hardt和Mendler-Dünner,2025;Mendler-Dünner等人,2025)以及经济学中的理性预期均衡的不动点特征(Muth,1961)等现代形式重新出现。
为了避免预言机利用这一通道,Fornasiere等人(2026)和Bengio等人(2025b)提出了*后果不变性*:切断任何可能告知系统其自身预测的下游后果的训练信号,使其无法学习偏向于期望结果。具体机制是只询问*反事实*问题,例如在假设答案被删除或以其他方式对现实没有影响的情况下估计某个事件的概率。
本文从一个简单的问题出发,探讨纯粹反事实解读的困难。一旦我们询问了预言机并获知了答案,反事实前提“……假设我从未得知这个答案”就不再成立:我们并不处于,也从未处于问题所询问的情境中,因为我们在提问的那一刻就知道我们会知道答案。从这个意义上说,反事实答案与我们实际居住的世界是无关的。因此,我们探索一种替代方案,它更接近于*自指*解读——“一旦我知道你的答案,会发生什么?”——同时解决自指解读所众所周知的非唯一性问题(Grunberg和Modigliani,1954)。其手段是不要求单一数字,而是一个小的、无偏的、自洽的*信念集*,并利用格不动点定理确定一个典范集。
## 2反事实查询与自指查询
“我的创业公司会成功吗?”可能有几个自洽的答案:是或否。同样,“我的创业公司成功的概率是多少?”可能一致地以90%或10%来回答。由于知晓答案的影响,这个问题在某种意义上是不明确的。预言机O应该将其解读为
- •“一旦我知道你对此问题的答案,我的创业公司会成功吗?”(*自指*版本),还是
- •“假设我不知道你对此问题的答案,我的创业公司会成功吗?”(*反事实*版本)?
Fornasiere等人(2026);Bengio等人(2025b)认为,我们可能只想问反事实类型的问题,以帮助避免预言机变得具有智能体性。但似乎一旦反事实问题的答案被获知,它立即变得无关紧要,因为前提正是——嗯——反事实的:我们并不处于,也从未处于问题所询问的情境中,因为我们知道在提问的那一刻我们就会知道答案。
因此,在本文中,我们探索一种避免“动机性”回应的替代策略,它更接近自指版本,但解决了非唯一性问题。主要思想是不要求“对事件B在前提A下的估计概率”,而是要求一个非空(且希望很小)的概率估计信念集C,使得答案既在某种意义上无偏,又在关于知晓答案的后果方面自洽。
## 3走向自洽的信念答案
第一次尝试是问:
> “列出所有介于0和1之间的p值,使得你相信:如果你告诉我们P(B∣A)=p,那么实际上P(B∣A且我们听到你回答p)=p。”
这将是无偏的,因为O会回答创业问题为集合{0.1, 0.9},而不是单个值0.1或0.9。然而,这仍然不是自洽的,因为我们现在获知了集合{0.1, 0.9},而不是问题假设中的任何单个成员值。换句话说,这个问题仍然是反事实的:我们询问如果O告诉我们某些单个值会发生什么,但O却告诉了我们一组值。
让我们把创业案例具体化。令A=“我们可以尝试创业”且B=“创业成功”,并假设反应函数
f(p)=P(B∣A且被告知p)是一条光滑、单调的曲线,起始于f(0)=0.05,结束于f(1)=0.95,并与对角线相交于p=0.1, p=0.8和p=0.9。这完全没有告诉我们P(B∣A且被告知一组p值)是什么。很可能P(B∣A且得知{0.1, 0.8, 0.9})=0.5。为了避免得到一个反事实的、因此无关的答案,我们需要通过使前提与输出类型一致来正确地实现自指。
所以我们的下一次(但还不是最终)尝试是问:
> “指定一个信念集C,使得你相信:如果你告诉我们P(B∣A且你告知C)属于C,那么这一声称确实会成真。”
如果O能够忠实地回答这个问题,这确实会带来一个一致的局面:给定A并听到C后B的概率确实会是C的一个元素。在创业案例中,可能P(B∣A且得知{0.1, 0.5, 0.8, 0.9})=0.5,因此O可以回答{0.1, 0.5, 0.8, 0.9}并且是正确的。然而,现在我们重新引入了非唯一性,因为O也可以同样地回答{0.1}或{0.9}并且仍然是正确的。更糟的是,O可能直接回答[0,1]并且总是正确:这将是完全无偏的,但也完全无用。
本文的其余部分旨在以一种*无偏*(不偏向任何概率值)且*非平凡*(不总是回答[0,1])的方式解决这种非唯一性。其思路是对C施加额外条件,使得解唯一存在。我们的策略是利用格论中的不动点定理。
## 4基于格论的构造
让我们固定两个任意命题(事件;可测集)A, B,我们关心P(B∣A,C),其中C是我们即将设计的问题的预言机答案。
令L=2^{[0,1]}表示[0,1]所有子集的系统。在集合包含关系下,它是一个完备格,下确界(infimum)和上确界(supremum)由交集和并集给出。注意条件P(B∣A,C)∈C类似于形式f(x)=x的不动点条件,只是我们要求的是成员关系而非相等。这表明,存在一个自洽的C可能可以通过使用适当的不动点定理或将其推广到集合包含的情况来证明。
然而,注意包含的方向是f(x)∈x而不是x∈f(x),因此我们不能直接使用诸如角谷定理之类的对应不动点定理。如果我们想应用现有定理而不是证明新定理,我们可以尝试将点值函数f(C):=P(B∣A,C)扩展到一个集值函数F(C)⊆[0,1]且满足f(C)∈F(C),因为那样真正的不动点条件F(C)=C就蕴含了我们关心的自洽性条件f(C)∈C。
我们应该如何定义F呢?我们不仅希望f(C)∈F(C),还希望能够证明F至少有一个不动点(存在性),并且其不动点集有一个“典范”成员,既无偏又相当小。
#### 选择域。
由于F输出[0,1]的子集,并且我们关心F的不动点,映射F只需要对[0,1]的子集有定义;因此其域D满足D⊆L。对于保序自映射可用的主要不动点定理是Knaster–Tarski定理。
###### 定理1 (Knaster–Tarski (Tarski, 1955))。
设(D,≤)是一个完备格,且F:D→D是保序的,即C1≤C2蕴含F(C1)≤F(C2)。则不动点集Fix(F)={C∈D:F(C)=C}是一个非空的完备格;特别地,它有一个最小元μF和一个最大元νF,
μF = inf{C∈D:F(C)≤C} = inf{C∈D:F(C)=C},
νF = sup{C∈D:C≤F(C)} = sup{C∈D:C=F(C)}.
因此我们希望D是一个在F下封闭的完备格。对于简单问题(A,B)(其答案不影响结果,如关于过去的问题),“相当小”应该意味着典范答案就是单点集C={P(B∣A)};因此D至少应该包含[0,1]中的所有单点集。
最直接的选择是D=L本身,它是一个具有良好性质的完备格。那么,我们能否在L上定义一个保序的F,使得对所有C都有f(C)∈F(C)呢?这将要求对所有C都定义P(B∣A,C),即每个C都必须在P所基的概率空间中可测,这要求过高。
下一个自然的候选域是包含所有单点集且只包含可测集的[0,1]的所有*闭*子集,因为闭集是勒贝格可测的。
###### 定义1。
令D为[0,1]的所有闭子集的集合,按包含关系排序。
###### 引理1。
D是一个完备格。一族{Ci}⊆D的下确界是交集⋂iCi,上确界是并集的闭包,⋂iCi的闭包。最小元是∅,最大元是[0,1]。
D中下确界是简单的交集——而上确界仅仅是并集的闭包——这一性质我们可能在下面会用到。
#### 定义F。
在完备格D上获得一个保序映射的标准方法是取一个任意的自映射G:D→D,并令
F(C) := sup_{C′≤C} G(C′)。(1)
###### 引理2。
对于任意G:D→D,(1)中定义的映射F是保序的,并且对所有C满足G(C)≤F(C)。
###### 证明。
如果C1≤C2,则{C′:C′≤C1}⊆{C′:C′≤C2},因此对更大指标集的上确界占优:F(C1)≤F(C2)。在上确界中取C′=C得G(C)≤F(C)。 ∎
由于这里≤是⊆,G(C)≤F(C)意味着G(C)⊆F(C);因此为了保证f(C)∈F(C),只需选择一个G使得f(C)∈G(C)。D上最小的这样的自映射是单点映射G(C)={f(C)}={P(B∣A,C)}∈D(单点集是闭的)。将其代入(1)并利用引理1求上确界,我们得到我们的提议:
F(C) = { P(B∣A,C′) : C′⊆C, C′闭 } 的闭包 (2)
其中P相似文章
公平输出,偏见内部:大语言模型在高风险决策中潜在偏见的因果效力与非对称性
本文研究了指令微调的大语言模型如何在高风险决策(如抵押贷款承销)中表现出公平输出,同时保留有偏见的内部表征,表明这些隐藏偏见具有因果效力、非对称性,且可通过激活引导加以利用。
从歧义话语到受控重用类别:规范化、商不变性与条件可判定性
本文提出一种形式化理论,用于在受控对话AI系统中定义答案重用,用数学刻画的已解析话语的商空间取代相似性启发式方法。
共识作为无标签自蒸馏的特权上下文
一篇研究论文,介绍了CANON,一种无标签自蒸馏方法,利用采样解之间的共识为训练大型语言模型在推理任务上提供密集的标记级监督,可将pass@1提升最多12个百分点,并以极少的计算量超越无标签强化学习。
LACE: 用于跨线程探索的格子注意力机制
LACE 引入了一种格子注意力机制,使LLM中的并发推理路径能够在推理过程中共享中间结果并相互纠正错误,相比标准的独立并行采样,推理准确度提高了7个多百分点。
@ddkang:来自Bridgewater AIA Labs、UIUC和MIT的新研究:我们证明了我们认为的首个非平凡泛化…
来自Bridgewater AIA Labs、UIUC和MIT的研究人员证明了首个针对使用RLVR训练的推理LLM的非平凡泛化界,为未见数据提供可证明的准确率下界,以指导安全部署。