为什么第三轴是自由
摘要
本文认为探索性建模(XM)优化的是“自由”而非生成表达能力,证明更大的候选池会增加未命中概率和自由,实证结果表明基于自由的选择在分布偏移下能提升泛化能力。
arXiv:2608.05423v1 公告类型:新
摘要:在生成式训练中,模型产生一个输出,并因其与示例的差异而受到惩罚。每次比较只有一个输出时,产生一个常见答案的模型可以胜过保留更广泛 repertoire 的模型。探索性建模(XM)每次比较产生 $K$ 个输出,并在最接近的一个上更新,声称探索是与生成表达能力相关的“第三预训练轴”。本文表明,第三轴实际上是自由,即模型行为所隐含约束的强弱。先前的工作表明,自由是函数的属性,而非形式的属性。参数、架构、最小描述长度(MDL)和数据可以变化,而行为约束保持不变。已有形式化证明,最弱的模型最可能泛化,且在归纳实验中,自由选择比 MDL 高出 110-500%。我证明了平均 XM 损失取决于候选未命中可接受区域的概率,探索将未命中概率提升到 $K$ 次幂。对于 $K>1$,匹配概率随自由增加而上升。接着我实证展示了 XM 优化的是自由。在正向 XM 实验中,更大的 $K$ 增加了或饱和了测得的自由,并在上下文相关目标下每个测试值都增加了自由。我训练了 XM 候选池,并将验证集选择与读取未标记父上下文的自由选择器进行比较。在 30 种情况中,自由在 29 种中胜出。生成表达能力是自由的一种模式计数代理,它丢弃了赋予自由泛化意义的扩展结构。XM 是手段,自由是目的,而在分布偏移下选择自由改进了 XM。
查看缓存全文
缓存时间: 2026/08/07 07:50
# 第三轴为何是自由
来源:https://arxiv.org/html/2608.05423
Michael Timothy Bennett
机器智能与规范性理论实验室
澳大利亚国立大学
堪培拉,ACT 2601,澳大利亚
m@michaeltimothybennett\.com
(2026年8月1日)
###### 摘要
在生成式训练中,模型产生一个输出,并因其与某个样本的差异而受到惩罚。由于每次比较只有一个输出,产生一个常见答案的模型可能胜过保留更广泛输出库的模型。探索式建模(Explorative Modeling,XM)每次比较产生KK个输出,并在最接近的输出上更新,声称探索是与生成表达能力相关的“第三条预训练轴”。在此我证明这第三条轴实际上是自由,即模型行为所隐含约束的强度之弱。前人工作已表明,自由是函数而非形式的属性。参数、架构、最小描述长度(MDL)和数据都可以变化,而行为约束保持不变。已有正式证明,最弱的模型最可能泛化,且自由选择在归纳实验中以110–500%的优势胜过MDL。我证明了平均XM损失取决于候选错过可接受区域的概率,而探索将该错失概率提升至幂KK。对于K\>1K\>1,匹配概率随自由增加而上升。随后我实证表明XM确实以自由为优化目标。在正向XM实验中,更大的KK提高或饱和了测得自由度,并在上下文相关目标下于每个测试值都增加了自由度。我训练了XM候选池,并将验证集选择与一个读取未标注父上下文的自由选择器进行比较。自由选择在30种情况中的29种中胜出。生成表达能力是自由的一个模态数量代理指标,但它丢弃了赋予自由以泛化意义的扩展结构。XM是手段,自由是目的,而针对自由的选择在分布偏移下改进了XM。
## 1引言
探索式建模(Explorative Modeling)在每一步训练中抽取KK个候选生成,将它们与一个数据点进行比较,并仅通过最接近的候选进行更新(Gladstone等人,2026(https://arxiv.org/html/2608.05423#bib.bib6))。该研究在图像、视频和语言模型上检验了这一更新方式,报告了随模型规模、数据和计算量增加而上升的收益,并将由此产生的能力称为*生成表达能力*(generative expressivity),定义为损失最小化器在一类数据分布上保留的最大模态数量。该更新属于更早的候选最小化(minimum-over-candidates)家族。多选择学习(Multiple Choice Learning)在预言机损失下训练了多个确定性结构化预测器(Guzmán-Rivera等人,2012(https://arxiv.org/html/2608.05423#bib.bib1))。随机多选择学习(Stochastic Multiple Choice Learning)随后将每个样本的梯度路由到深度集成中损失最低的成员(Lee等人,2016(https://arxiv.org/html/2608.05423#bib.bib3))。Fan、Su和Guibas在2016年12月的预印本中引入了Min-of-N条件生成,为每个输入抽取若干高斯潜在扰动,并针对最接近目标的生成点云进行训练(Fan等人,2017(https://arxiv.org/html/2608.05423#bib.bib2))。除记号和外层目标中的输出度量外,其条件随机候选最小化形式与硬正向XM完全相同。IMLE随后出现,采用共享的全局模型样本池,将每个数据点与其最近的生成样本匹配,并表明在陈述条件下所得估计量与最大似然一致(Li和Malik,2018(https://arxiv.org/html/2608.05423#bib.bib4))。XM论文将IMLE归类为端到端正向XM的共享池实例。XM的贡献在于更广泛的正向与反向框架、与现代生成式架构的整合、生成表达能力的解释,以及对KK作为缩放变量的研究(Gladstone等人,2026(https://arxiv.org/html/2608.05423#bib.bib6))。然而我将表明,生成表达能力不如一种已存在的函数自由度度量。这一概念最初是为了处理AIXI通用强化学习代理性能的主观性而提出的(Hutter等人,2024(https://arxiv.org/html/2608.05423#bib.bib438))。栈理论(Stack Theory)度量函数自由度,以避免AIXI对形式相关复杂性度量的依赖(Bennett,2023(https://arxiv.org/html/2608.05423#bib.bib214))。一个学习者已经观察到一个训练集或“子任务”。它必须选择模型参数,这些参数定义一个“策略”,而学习者希望其选择的策略能够泛化,以解决更广泛的父任务。许多策略在该子任务上仍然正确,但只有一部分能很好地泛化。当任务扩展到父任务时,哪个策略最可能保持正确?答案是最弱的正确策略,即其扩展包含最多兼容补全的正确策略(Bennett,2025(https://arxiv.org/html/2608.05423#bib.bib224))。约束的弱可以更直观地理解为自由。学习最弱正确策略的过程在先前工作中被称为“w-maxing”或“free-maxing”,通常被框定为一种函数度量,以区别于平坦性或复杂性等形式度量(Bennett,2026(https://arxiv.org/html/2608.05423#bib.bib235); Hochreiter和Schmidhuber,1997(https://arxiv.org/html/2608.05423#bib.bib152); Solomonoff,1978(https://arxiv.org/html/2608.05423#bib.bib657); Hutter等人,2024(https://arxiv.org/html/2608.05423#bib.bib438); Rissanen,1978(https://arxiv.org/html/2608.05423#bib.bib601))。这一结果先于探索式建模,将泛化与简单性及参数形式区分开来(Bennett,2024b(https://arxiv.org/html/2608.05423#bib.bib218),2026(https://arxiv.org/html/2608.05423#bib.bib235))。除了在时间上被自由概念抢先之外,我将表明生成表达能力还有若干相对弱点:
1. 1\. 它无法对在同一目标下训练的两个模型进行排序。自由可以做到这一点,而这对于任何可称为“轴”的东西都是必要的。
2. 2\. 它取最小化器集合的上确界,因此不能描述训练实际选择出的模型。
3. 3\. 它是自由的一个目标层面的模态数量代理。仅当具体语言将输出模态视为独立对称的许可时,它才与局部自由的单调变换一致。
4. 4\. 没有任何定理将其与最优泛化联系起来。
5. 5\. 它可以在自由大幅变化时保持不变。
然而这两条研究路线可以是互补的。在本文中我将表明,XM是“自由最大化”(free-maxing)的一种极好手段,实际上为一个相当冷门但不仅在计算机科学、也在哲学和神经生物学中具有重要意义的理论提供了大规模的经验证据(Bennett,2024a(https://arxiv.org/html/2608.05423#bib.bib219),2025(https://arxiv.org/html/2608.05423#bib.bib224); Solé等人,2026(https://arxiv.org/html/2608.05423#bib.bib655))。该理论反过来又展示了如何进一步改进XM,而我将在实证中演示这种改进。
探索记录的是训练检视了多少个候选。模型函数所隐含约束的弱度(自由)是训练后策略保留的兼容补全体量(Bennett,2025(https://arxiv.org/html/2608.05423#bib.bib224))。前者是预算意义上的手段,后者是目的,是具体语言中函数的属性。一个策略可以允许许多输出,使其扩展因子很大,同时几乎将所有采样质量集中在一个被允许的输出上。另一个策略可以允许较少的输出但均匀地分配质量。有限的best-of-KK训练可以偏好其中任何一种。因此,二者之间的关系需要通过概率质量来建立。我完整地推导了这一关系。核心恒等式是
RK(π)=∫0∞Ec,Y[(1−Q~π,c,Y(At(Y)))K]dt,R\_\{K\}(\\pi)=\\int\_\{0\}^\{\\infty\}\\mathbb\{E\}\_\{c,Y\}\\left\[\\left\(1\-\\widetilde\{Q\}\_\{\\pi,c,Y\}(A\_\{t\}(Y))\\right\)^\{K\}\\right\]\\,\\mathrm\{d\}t,
其中At(Y)A\_\{t\}(Y)是损失在tt以内的生成集合,Q~\\widetilde\{Q\}是训练候选分布。探索将变换1−(1−q)K1\-\(1\-q\)^\{K\}应用于可接受候选质量。当训练候选分布与部署分布一致时,该质量位于部署策略所允许的输出上。在下文构造的有限语言中,这些许可的数量决定了自由。我建立了以下结果:
1. 1\. 我为任意可测输出空间、非负损失和目标相关的训练候选分布推导了精确的best-of-KK覆盖恒等式。
2. 2\. 我表明硬目标收敛到训练候选分布的本质损失下确界。在部署一致性和距离损失下,这等价于到部署支撑集的距离。
3. 3\. 我构造了一个有限的生成式栈理论语言,其中随机生成器导出一个策略,其隐含约束的弱度(自由)具有闭式形式。
4. 4\. 我表明在均匀目标下,best-of-KK成功等价于期望的不同输出覆盖数。
5. 5\. 我证明对于每个K\>1K\>1,平衡的采样覆盖率随局部自由严格上升。对于固定的目标支撑集大小,局部自由增加了额外一个候选的边际收益。
6. 6\. 我解决了有限非均匀问题。有限KK偏向常见目标。随着KK增长,最优解收敛到目标完整支撑集上的均匀质量。
7. 7\. 我定义了独立的非空未见需求,并证明未来兼容性与未见自由精确成正比。
8. 8\. 我将确定性KK头模型分离为一个特例。只有该特例具有KK的支撑上限。
9. 9\. 我测试了基于样本的正向XM是否在144次神经运行中将更大的KK转化为更大的自由度。结果确实如此。
10. 10\. 我测试了一个前瞻性校准的自由选择器是否能在两个选择器读取同一XM训练候选池时提高平衡父任务的表现。结果确实如此。
结果是一个正式的劳动分工。参数和数据可以扩大模型能够体现的许可区域,而部署一致的探索控制训练在多大程度上奖励对该区域的采样访问。所诱导的策略自由是所选具体语言中的函数层面量。这为所报告的缩放交互提供了一个可检验的解释,而无需将KK、模态数量和自由视为同义词。
## 2弱度,现更名为自由
我使用博士论文及相关同行评审论文中的栈理论定义(Bennett,2025(https://arxiv.org/html/2608.05423#bib.bib224))。由于人们不喜欢“弱度”这个名字,我一直在将其改为“自由”,并将w-maxing改为“free-maxing”(自由最大化)。
###### 定义1(环境与具体语言)。
环境是互斥状态的非空集合Φ\\Phi。程序是任何集合p⊆Φp\\subseteq\\Phi,且P:=2Φ\\mathcal\{P\}:=2^\{\\Phi\}是所有程序的集合。词汇表是P\\mathcal\{P\}的有限子集v⊆P\\mathfrak\{v\}\\subseteq\\mathcal\{P\}。它诱导具体语言
Lv:=\{l⊆v | ⋂p∈lp≠∅\}。L\_\{\\mathfrak\{v\}\}:=\\left\\\{l\\subseteq\\mathfrak\{v\}\\ \\middle\|\\ \\bigcap\_\{p\\in l\}p\\neq\\varnothing\\right\\\}。
LvL\_\{\\mathfrak\{v\}\}的成员是陈述。按照惯例,空族的交集为Φ\\Phi,因此∅∈Lv\\varnothing\\in L\_\{\\mathfrak\{v\}\}。
解释。词汇表是身体在所选层面能够实现的有限区分集合。陈述是一束能够同时成立的区分。可满足性条件排除了身体无法实例化的组合。
###### 定义2(扩展与自由)。
对于l∈Lvl\\in L\_\{\\mathfrak\{v\}\},定义
Ext(l):=\{y∈Lv∣l⊆y\}。\\operatorname\{Ext\}\(l\):=\\\{y\\in L\_\{\\mathfrak\{v\}\}\\mid l\\subseteq y\\\}。
ll的自由为
w(l):=\|Ext(l)\|。w\(l\):=\|\\operatorname\{Ext\}\(l\)\|。
解释。补全添加承诺同时保留ll中的每一个承诺。自由计算还有多少这样的细化是可能的。它计算的是具体化的补全数量,而非参数设置或版本空间。
###### 定义3(任务与正确策略)。
对于X⊆LvX\\subseteq L\_\{\\mathfrak\{v\}\},记
Ext(X):=⋃x∈XExt(x)\\operatorname\{Ext\}\(X\):=\\bigcup\_\{x\\in X\}\\operatorname\{Ext\}\(x\)。
任务是二元组α=⟨Iα,Oα⟩\\alpha=\\langle I\_\{\\alpha\},O\_\{\\alpha\}\\rangle,其中Iα⊆LvI\_\{\\alpha\}\\subseteq L\_\{\\mathfrak\{v\}\}且Oα⊆Ext(Iα)O\_\{\\alpha\}\\subseteq\\operatorname\{Ext\}\(I\_\{\\alpha\}\)。策略是任何陈述π∈Lv\\pi\\in L\_\{\\mathfrak\{v\}\}。它对于α\\alpha正确,当且仅当
Ext(Iα)∩Ext(π)=Oα。\\operatorname\{Ext\}\(I\_\{\\alpha\}\)\\cap\\operatorname\{Ext\}\(\\pi\)=O\_\{\\alpha\}。
记Πα\\Pi\_\{\\alpha\}为正确策略的集合。
解释。正确性将策略集固定到已观察任务上。自由比较不同策略在满足该要求后保留的补全体量。最弱正确策略是在正确性边界内最大化自由的策略。它在不施加不必要约束的情况下维持系统的完整性。对于连续语言,栈理论用测度μ\\mu替代计数,并定义wμ(π):=μ(Ext(π))w\_\{\\mu\}\(\\pi\):=\\mu\(\\operatorname\{Ext\}\(\\pi\)\)(Bennett,2026(https://arxiv.org/html/2608.05423#bib.bib235),2025(https://arxiv.org/html/2608.05423#bib.bib224))。下文的有限理论使用计数测度。第3节(https://arxiv.org/html/2608.05423#S3)中的一般best-of-KK恒等式不要求有限性。
### 2\.1生成式语言
从有限支撑轮廓到自由的映射,在语言规定了生成器允许哪些输出之后变得完美¹¹嗯,应该说变得“精确”,但在LLM毁掉这个词之后我不太愿意用它。。
###### 定义4(许可轮廓)。
设CC为有限的非空上下文集合,设YY为具有\|Y\|≥2\|Y\|\\geq 2的有限输出集合。许可轮廓是映射
F:C⟶2Y∖\{∅\}。F:C\\longrightarrow 2^\{Y\}\\setminus\\\{\\varnothing\\\}。
值F(c)F\(c\)是在上下文cc处允许的非空输出集合。
解释。上下文可以是提示、损坏图像或掩码序列。轮廓记录了部署生成器在每个上下文处以正概率发射的每一个输出。
###### 定义5(生成式许可语言)。
设Φ\\Phi为所有许可轮廓的集合。对于每个(c,y)∈C×Y\(c,y\)\\in C\\times Y,定义排除程序
ec,y:=\{G∈Φ∣y∉G(c)\}。e\_\{c,y\}:=\\\{G\\in\\Phi\\mid y\\notin G\(c\)\\\}。
设
v:=\{ec,y∣c∈C,y∈Y\}。\\mathfrak\{v\}:=\\\{e\_\{c,y\}\\mid c\\in C,\\ y\\in Y\\\}。
对于轮廓FF,定义其策略
πF:=\{ec,y∈v∣y∉F(c)\}。\\pi\_\{F\}:=\\\{e\_\{c,y\}\\in\\mathfrak\{v\}\\mid y\\notin F\(c\)\\\}。
解释。策略陈述了生成器执行的每一个排除。一个允许更多输出的生成器断言更少的排除。因此它体现了更弱的约束。
###### 命题1(闭式自由)。
映射F↦πFF\\mapsto\\pi\_\{F\}是从许可轮廓到LvL\_\{\\mathfrak\{v\}\}的双射。如果ac:=\|F(c)\|a\_\{c\}:=\|F\(c\)\|,则
w(πF)=∏c∈C(2ac−1)。w\(\\pi\_\{F\}\)=\\prod\_\{c\\in C\}\\left\(2^\{a\_\{c\}\}\-1\\right\)。
###### 证明。
陈述l⊆vl\\subseteq\\mathfrak\{v\}在每个上下文处排除集合
Xc(l):=\{y∈Y∣ec,y∈l\}X\_\{c\}\(l\):=\\\{y\\in Y\\mid e\_\{c,y\}\\in l\\\}。
ll中的程序具有非空交集,当且仅当Y∖Xc(l)Y\\setminus X\_\{c\}\(l\)对于每个cc都非空。因此陈述通过F(c)=Y∖Xc(l)F\(c\)=Y\\setminus X\_\{c\}\(l\)与轮廓一一对应。一个陈述的扩相似文章
探索式建模:解锁第三个预训练轴与端到端生成
本文介绍了探索式建模(Explorative Modeling),这是一种新的生成建模范式,通过探索模型生成与数据之间的候选匹配来分解训练循环。它确立了除参数和数据之外的第三个预训练轴,提高了图像、视频和语言领域的扩展效率,并以更少的推理步骤实现端到端生成建模。
模型能力主导:AIMO 3推理时优化的经验启示
本论文分析了AIMO 3的推理时优化技术,发现模型能力优于提示工程和多样化采样策略。研究表明高温度采样已经能够最大程度地去相关化误差,为基于提示的改进留下了很少余地,并识别出单个模型pass@20与多数投票共识之间存在6分的选择损失差距。
衡量人工智能的自由
本文利用强化学习探讨了人工智能代理中的“价值自由”概念,将其定义为基于 Q 值衍生出的不可预测性和熵的度量。
学习者能动性与自主性的大规模语义映射揭示测量与生成式AI研究忽视的内容
本文利用对超过14,000篇出版物的大规模语义分析,绘制了学习者能动性与自主性的定义图谱,揭示了三个维度,并指出现有量表系统性地低估了社会文化维度。文章指出,当前教育领域的生成式AI研究过度聚焦于学习调控,从而窄化了为AI中介学习环境所设计的行为库。
多样性注入的位置至关重要:面向多样化生成的统一框架
本文提出了一个用于大型语言模型测试时多样化生成的统一框架,根据多样性注入的位置(表面级 vs. 规范级)对方法进行分类。它提出了规范级方法,首先生成多样化的中间规范,然后基于这些规范生成最终响应。在五个开放任务和四个骨干模型上,规范级注入在保持质量的同时提升了输出多样性。