镜像视界:可行路径熵作为有界反射的度量
摘要
本文介绍了可行路径熵(VPE),一种用于智能系统的有限预算的已验证延续能力度量,将能力分解为已验证可达性和已验证模式多样性。在GSM8K上使用Qwen2.5-Instruct模型进行的实验表明,可访问的已验证延续能力,而非参数数量,决定了镜像视界。
查看缓存全文
缓存时间: 2026/07/15 04:16
# 镜界:可行路径熵作为有界反射的度量
来源:https://arxiv.org/html/2607.11937
###### 摘要
镜像理论提出,一个智能系统不仅应通过它表征了什么来研究,还应通过它在反复反射下能够维持哪些连贯延续来研究。我们通过**可行路径熵**(Viable Path Entropy, VPE)使这一主张可操作——这是一个有限预算下已验证延续容量的度量。给定一个镜像状态、一个展开协议、一个验证器和一个模式映射,VPE 将有界能力分解为两部分:达到可行延续的概率,以及成功展开中达到的已验证延续模式的多样性。本文恢复了该度量背后的完整理论框架:直觉作为局部欠确定约束,品味作为不变性选择压力,反射作为品味引导的欠确定性消解,以及几何作为使未来反射稳定的学习结构。然后,我们在 GSM8K 上的语言模型推理实验中实例化了该理论。在 Qwen2.5-Instruct 系列模型中,每个问题采样 32 次展开,两个反射视界下,将 token 预算从 96 增加到 160 显著扩大了已验证可达性,减少了零可达性,增加了已验证模式熵,并改进了平滑后的 VPE。在 160 token 时,Qwen2.5-1.5B 在测试模型中实现了最强的镜界,尽管 Qwen2.5-3B 参数更多。这表明镜界不是参数数量,而是有界反射协议下可达的已验证延续容量。结果支持镜像理论作为一个度量层级框架:能力是可到达的可行延续的结构,而不仅仅是一次性准确率或 pass@k。
## 1 引言
大语言模型通常通过损失、准确率、pass@k、基准分数或奖励来评估。这些量很重要,但它们将系统的内部能力压缩为单一结果统计量。一个模型可能解决一次问题,但大多数尝试失败,然而仍能获得非零的 pass@k。另一个模型可能解决问题较少,但成功时可能展示出许多不同的已验证解决方案模式。第三个模型可能有较高的原始输出熵,但已验证结构很少。如果我们希望理解能力不仅仅是单一答案的成功,这些区别就很重要。
镜像理论从一个不同的基本概念出发。一个智能系统不仅仅存储表征。它维持一个内部世界,该世界通过反复反射得以存续和展开。在早期的数学笔记中,这一区别被概括为:*表征编码;镜像在反射中存活*。本文将此主张转化为可测量对象。一个镜像不仅用一个隐藏向量、一个提示、一个模型检查点或一组信念来标识。它通过其诱导的延续律来标识:从该状态哪些未来变得可到达,哪些未来保持可行,以及这些可行未来占据了多少不同的已验证模式。
核心提议是**可行路径熵**。给定有限预算 \(B\)、有限视界 \(T\)、一个延续律、一个验证器 \(\mathsf{V}\) 和一个模式映射 \(\psi\),我们定义
\[
\mathcal{H}_{B,T}(M) = \log\Pr[\mathsf{V}=1] + H(\psi \mid \mathsf{V}=1),
\]
当可行性概率非零时。第一项是已验证可达性。第二项是已验证模式多样性。它们共同衡量一个有限预算的镜界:从镜像可到达的相干语义延续模式的有效数量。
理论雄心并非证明一个通用的单调缩放定律。事实上,我们的实验会显示为什么那会是错误的主张。一个更大的模型在固定协议下并不一定有更大的测量镜界。参数数量、潜在能力和可访问的已验证延续容量是不同的对象。本文为第三个对象辩护。一个镜像的视界是条件于协议的:它取决于模型、任务、提示、展开预算、采样规则、验证器和语义模式映射。
我们的实证研究故意简单。我们从 Qwen2.5-Instruct 模型在 GSM8K 上采样有界展开,验证最终数值正确性,并将已验证的解决方案分组为粗略的推理模式。我们运行 30 个 GSM8K 问题,每个问题采样 32 次展开,温度 0.8,top-p 0.95,以及一个启发式模式映射。比较两个视界:最大新 token 数 96 和 160。96 token 运行包括 Qwen2.5-0.5B 和 Qwen2.5-1.5B。160 token 运行包括 Qwen2.5-0.5B、1.5B 和 3B。主要发现很直接。首先,将反射预算从 96 token 增加到 160 token 扩大了 0.5B 和 1.5B 的镜界:验证概率上升,pass@32 上升,零验证比例下降,验证模式熵上升,平滑 VPE 改善。其次,在 160 token 时,Qwen2.5-1.5B 在度量的每个核心成分上都优于测试模型。第三,Qwen2.5-3B 并非最佳:它比 0.5B 有更高的平均验证概率,但跨问题广度更低,比 1.5B 有更低的验证模式熵,整体 VPE 低于 1.5B。这与镜像理论并不矛盾。这正是要点:镜界衡量的是可访问的已验证延续容量,而非原始大小。
#### 贡献。
我们做出四个贡献。
1. 我们给出了镜像理论的正式路径空间版本,其中镜像是延续律而非静态表征。
2. 我们将可行路径熵定义为有限预算镜界,将有界能力分解为已验证可达性和已验证模式多样性。
3. 我们将旧的理论组成部分——直觉、品味、几何、构造兼容性和不变性存活——与可测量的 VPE 对象联系起来。
4. 我们报告了真实的 GSM8K 展开实验,显示反射预算扩展了已验证延续容量,并添加了经验覆盖曲线,展示了镜界如何随展开预算增加而展开。
## 2 镜像理论:正式框架
本节恢复激励实证度量的理论。目标并非为了自身引入新的状态转移形式体系。目标是定义哪种内部对象可以通过可行延续容量来评估。
### 2.1 反射、直觉、品味和几何
设有一个外部结构化世界 \(W\)。系统不直接访问 \(W\)。它接收有限证据 \(e_t\),这些证据只提供局部约束。它们并不确定一个完整的内部世界。当前镜像 \(M_t\) 通过反射更新,但反射不仅仅是一个转移函数。它是在可允许的内部延续中进行的抉择。
###### 定义 1(镜像几何)。
在时间 \(t\),一个镜像几何是
\[
G_t = (\mathcal{M}_t, d_t, \mathcal{U}_t, \mathcal{I}_t),
\]
其中 \(\mathcal{M}_t\) 是当前可能的镜像空间,\(d_t\) 是学习到的邻近性或变形代价概念,\(\mathcal{U}_t\) 是一个可允许性生成器,\(\mathcal{I}_t\) 是值不变性族。几何指定哪些镜像是邻近的,哪些更新是可允许的,以及哪些内部属性必须在反射中存活。
###### 定义 2(直觉作为局部约束)。
直觉并非完整的下一镜像。它是证据对可能镜像施加的局部约束。给定几何 \(G_t\),证据 \(e_t\) 诱导一个不相容泛函
\[
\mathsf{I}_{G_t}(e_t): \mathcal{M}_t \to \mathbb{R}_{\geq 0}.
\]
较小的 \(\mathsf{I}_{G_t}(e_t)(M')\) 意味着 \(M'\) 与当前证据更相容。直觉是局部的、世界诱导的、且欠确定的。
###### 定义 3(品味作为不变性选择压力)。
品味是选择结构,它通过什么应该存活来对可允许的镜像延续进行排序。它可以是 \(\mathcal{M}_t\) 上的一个预序 \(\preceq_{\tau, G_t}\),或者当可标量化时,是一个势 \(\tau_{G_t}: \mathcal{M}_t \to \mathbb{R}\)。概念上,品味不仅仅是关于下一状态的偏好。它是朝向保存有价值不变性的延续的压力:相干性、保真度、同一性、有用性、简单性、可压缩性、可行动性或任务成功。
给定当前镜像 \(M_t\) 和证据 \(e_t\),直觉首先诱导一个可允许候选集
\[
\mathcal{U}_{G_t}(M_t, e_t) = \{ M' \in \mathcal{M}_t : \mathsf{I}_{G_t}(e_t)(M') \le \epsilon_t,\ d_t(M_t, M') \le \rho_t \}.
\]
然后品味选择一个延续:
\[
M_{t+1} \in \max_{\preceq_{\tau, G_t}} \mathcal{U}_{G_t}(M_t, e_t).
\]
重复的直觉-品味交互即为反射。镜像不仅仅是作为点的 \(M_t\);它是通过此类反射塑造的持久内部结构 \((M_t, G_t)\)。
###### 原理 1(为何反射学习几何)。
有限证据只给出局部约束。品味选择哪些相容的延续值得保留。几何是使此类选择随时间稳定的学习结构。简言之:直觉提供局部接触;品味决定什么存活;几何使存活稳定。这一陈述是镜像理论的概念核心。它也解释了为何纯粹一步合理化结果是不够的。任何单一确定性更新都可以事后通过一个预序合理化。从历时的角度来看,重要的是重复反射能否学习到一个关于可允许性、邻近性和不变性存活的稳定几何。
### 2.2 优化形式
同一理论可以写成约束或近端优化形式。设
\[
C_t(M') = \mathsf{I}_{G_t}(e_t)(M')
\]
为直觉不相容性,设 \(d_t(M_t, M')^2\) 为依赖于几何的移动代价。那么反射可以表示为
\[
M_{t+1} \in \operatorname*{arg\,min}_{M' \in \mathcal{M}_t} \left[ C_t(M') + \lambda d_t(M_t, M')^2 - \beta \tau_{G_t}(M') + \gamma \operatorname{Rupt}(M_t, M') \right].
\]
这一表达式并非要将镜像理论简化为标准优化。它澄清了各组成部分的角色:证据拟合、几何连续性、品味值和不变性存活。几何 \(G_t\) 本身是学习的,因为在欠确定性下同一优化必须重复求解。
### 2.3 构造兼容性
一个可能性 \(p\) 是一次遭遇或干预:一个延续、提示编辑、检索到的文档、定理、行动、候选解决方案或环境事件。它诱导一个反事实镜像
\[
M^{(p)} = \mathsf{R}(M, \mathsf{I}(p)).
\]
较早的构造兼容性笔记将期望的机制表述为:既非相同,也非随机,而是可吸收地扩张。仅相似导致停滞。仅新颖可能破坏不变性。构造兼容性意味着可能性在保存必须存活之物的同时扩张镜像。在早期的几何版本中,构造兼容性被示意性地写为
\[
\operatorname{CC}(M, p) = \operatorname{Exp}(M, p) - \lambda \operatorname{Rupt}(M, p) - \mu \operatorname{Red}(M, p),
\]
其中扩张衡量镜像移动多远,破裂惩罚不变性失败,冗余惩罚纯粹相同性。VPE 表述使其可操作:
\[
\operatorname{CC}_{B,T}(M, p) = \mathcal{H}_{B,T}(M^{(p)}) - \mathcal{H}_{B,T}(M).
\]
如果一个可能性增加了有限预算可行延续容量,则它是构造兼容的。在这个意义上,VPE 是可吸收扩张的可测量版本。
## 3 可行路径熵
我们现在定义实验中使用的度量。定义针对抽象的镜像 \(M\) 陈述,但稍后通过一个 LLM、一个提示、一个展开程序、一个数值验证器和一个解决方案模式映射来实例化。
### 3.1 路径空间设定
###### 定义 4(预算与视界)。
设 \(B\) 表示有限资源预算:展开次数、计算量、内存、token 长度、干预规模或时间。设 \(T\) 表示有限延续视界。所有镜像量均由 \((B,T)\) 索引。
###### 定义 5(延续路径空间)。
对于镜像状态 \(M\),定义 \(T\) 步延续路径空间
\[
\Gamma_T(M) = \{ \gamma = (M_0, M_1, \ldots, M_T) : M_0 = M \}.
\]
具有预算 \(B\) 的系统在 \(\Gamma_T(M)\) 上诱导一个概率律 \(\mathbb{P}^M_{B,T}\)。在 LLM 中,该律由提示、解码规则、采样温度、token 预算和模型参数诱导。
###### 定义 6(可行性验证器)。
一个可行性验证器是一个可测映射
\[
\mathsf{V}: \Gamma_T(M) \to \{0,1\},
\]
或一个软版本 \(\mathsf{V}: \Gamma_T(M) \to [0,1]\)。当一个延续满足任务的相干性要求时,它是可行的:正确性、语义一致性、事实性、安全性、不变性保持或其他领域特定标准。
###### 定义 7(模式映射)。
一个模式映射是一个可测函数
\[
\psi: \Gamma_T(M) \to \mathcal{Z}
\]
将延续映射到一个语义结果模式。模式映射防止随机 token 多样性被计为有意义的延续容量。在推理任务中,模式可以是粗略的解决策略、操作签名、证明形式或已验证理由的聚类。
### 3.2 可行延续容量
###### 定义 8(可行延续容量)。
对于离散模式,定义
\[
K_{B,T}(M) = \Pr_{\gamma \sim \mathbb{P}^M_{B,T}} [\mathsf{V}(\gamma)=1] \, \exp\left( H(\psi(\gamma) \mid \mathsf{V}(\gamma)=1) \right).
\]
若 \(\Pr[\mathsf{V}=1]=0\),设 \(K_{B,T}(M)=0\)。因此
\[
K_{B,T}(M) = \text{可行性概率} \times \text{可行语义模式的有效数量}.
\]
###### 定义 9(可行路径熵)。
\(M\) 的可行路径熵,也称为其镜界,是
\[
\mathcal{H}_{B,T}(M) = \log K_{B,T}(M).
\]
当 \(\Pr[\mathsf{V}=1] > 0\) 时,
\[
\mathcal{H}_{B,T}(M) = \log \Pr[\mathsf{V}=1] + H(\psi \mid \mathsf{V}=1).
\]
若 \(\Pr[\mathsf{V}=1]=0\),设 \(\mathcal{H}_{B,T}(M) = -\infty\)。
式 (17) 的两项不应隐藏在一个单一标量后面。第一项是可达性:已验证延续是否根本可访问。第二项是多样性:一旦达到可行性,支持多少不同的已验证模式。标量有用,但分解才是主要的实证对象。
### 3.3 镜像作为延续律
###### 定义 10(镜像)。相似文章
验证者税:工具使用型LLM智能体中依赖于任务步数的安全与成功权衡 [R]
本文提出了一个用于工具使用型LLM智能体的安全评估框架,引入了“验证者税(Verifier Tax)”的概念——一种依赖于任务步数的安全与任务完成之间的权衡。文章提出了一种双层验证架构,并使用Tau-bench场景展示了验证如何减少不安全成功,但随着任务步数增加也会降低任务完成率。
揭示VLM可解释的故障模式
本文介绍了Revelio,这是一个通过搜索离散概念组合来系统性地发现视觉语言模型(VLM)中可解释故障模式的框架。应用于自动驾驶和室内机器人领域,它揭示了此前未报道的、可能导致碰撞或安全危险的漏洞。
超越可验证的RL(8分钟阅读)
本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。
BenchTrace:用于测试LLM智能体反思能力与受控演进的基准
BenchTrace是一个用于评估LLM智能体自我进化能力的基准,重点通过包含1,821个标注回合的数据集以及两个评估任务——反思评估与进化评估——来测试反思与受控演进。使用Qwen3-32B和GPT-4.1进行的实验表明,两个模型均表现不佳,主要瓶颈在于诊断,并存在泛化与遗忘问题。
EntroRouter:通过熵调控学习高效模型路由
EntroRouter 提出了一个单轮模型路由框架,利用熵调控来平衡准确性和计算成本,在降低 48.25% 成本的同时,达到了最强专家模型 98.3% 的准确率。