超越多模态对齐:通过响应替换和有序执行认证物理语言
摘要
本文介绍Disjoint-Bridge Operator-Substitution Certificate (DBOSC),以认证模态编译器在物理语言表示中的可互换性,并评估受控弹塑性系统中的有序执行,分离了属性访问、响应替换、融合闭包和有序执行的不同能力。
arXiv:2608.19492v1 Announce Type: new
摘要:世界模型越来越多地将紧凑的多模态表示视为感知和物理交互之间的接口,但现有探针并未确定不同传感器是否携带相同的可执行含义,或者该含义是否在新的动作组合中得以保留。我们引入了一个操作能力层次结构和Disjoint-Bridge Operator-Substitution Certificate (DBOSC),它询问独立训练的模态编译器是否能够在训练面板之外的证据上互换地进入冻结的响应图表。在Cluster Haptic上,相同未见表面的触觉、音频和加速度表示在响应空间中比错误表面配对近4.5倍,差距在所有19个保留表面上成立;解封保留响应证实每个分支预测的物理性能都优于群体图表。然后,我们在具有互补模态盲点的受控弹塑性系统中测试有序执行。在预注册预算下,前提条件拒绝堆栈,因为冻结的执行器甚至无法通过保留程序推进精确的图表坐标。在收敛预算下,相同的三级图表执行这些程序(oracle NMSE 0.18),融合改进了两种模态,16个注册检查中有14个通过;两个失败是因为融合信息矩阵的对角限制表现与完整矩阵一样好。清除门限是执行器的属性,而不是图表的:一个发射整个程序而不是共享每步动态的执行器比同一图表上的实体盲预测器差38倍。一个匹配的不可识别性结果解释了为什么仅压缩和融合无法确定未见的组合定律。这些结果将属性访问、响应替换、融合闭包和有序执行分离为不同的、可单独测试的成就。
查看缓存全文
缓存时间: 2026/08/21 10:24
# 超越多模态对齐:通过响应替换与有序执行验证物理语言
来源:https://arxiv.org/html/2608.19492
**Kaizhen Tan**
所属机构:纽约大学,美国纽约州纽约市
所属机构:卡内基梅隆大学,美国宾夕法尼亚州匹兹堡市
**Siru Tao**
所属机构:卡内基梅隆大学,美国宾夕法尼亚州匹兹堡市
**Yixiao Li**
所属机构:卡内基梅隆大学,美国宾夕法尼亚州匹兹堡市
**Hanzhe Hong**
所属机构:卡内基梅隆大学,美国宾夕法尼亚州匹兹堡市
**Yang Feng**
所属机构:哥伦比亚大学,美国纽约州纽约市
**Heqing Du**
所属机构:哥伦比亚大学,美国纽约州纽约市
###### 摘要
世界模型日益将紧凑的多模态表征视为感知与物理交互之间的接口,然而现有探测方法并未确定通过不同传感器获取的信息是否承载相同的可执行意义,或者在新的动作组合下是否依然有效。我们引入了一个**操作能力层级结构**以及**不相交-桥接算子-替换证书**,该证书用于考察:在独立训练的模态编译器面对超出其训练面板范围的证据时,是否能可互换地使用冻结的响应表。在 **Cluster Haptic** 实验中,同一未知表面的触觉、音频和加速度表征在响应空间中的距离,比错误表面配对的情况近 4.5 倍,且这一差距在所有 19 个未见表面上均成立;随后解封预留的响应数据证实,每个分支对物理规律的预测也优于总体基准。接着,我们在一个具有互补模态盲区的受控弹塑性系统中测试有序执行,此时证书充当的是**工具而非结论**。在预设预算下,其自身的先决条件就拒绝了该组合,因为即使提供精确的图表坐标,冻结的执行器也无法推进一个未见程序。在收敛预算下,同一个三阶图表执行了这些程序(**Oracle NMSE 0.18**),融合方法优于单一模态,且 16 个注册检查中有 14 个通过;两个失败案例源于同一原因,即融合信息矩阵的对角约束与完整矩阵效果相当。此外,通过测试是执行器的属性,而非图表的属性:一个输出完整程序而非共享逐步动力学的执行器,在相同图表上的表现比**实体无关预测器**差 38 倍。一个匹配的**不可辨识性**结果表明,仅靠压缩和融合无法确定未知的组合规律。总之,这些结果将**属性访问**、**响应替换**、**融合闭合**和**有序执行**区分为不同的、可独立测试的能力。
## 1 引言
图 1:一个词(属性)可跨传感器替换;一个短语(动作组合)仅在其执行器可行时才可执行。
(a) 一次机器人扫描产生关于不相交面板 P₀, P₁ 的音频和加速度证据。四个编译器独立拟合——没有匹配损失,也没有实体标识符——冻结的解码器 G(θ,q) 为它们的坐标赋予共享的语义。曲线是解码后对两个面板之外一个未知表面的响应:两个来源达成一致,而错误的表面则不一致。
(b) 一个具有精确互补盲区的受控弹塑性实体;每张插图绘制了不可见坐标的四个隐藏层级,它们彼此一致。精确的 θ* 绕过编译器,驱动一个冻结的执行器在 AB 和 BA 序列上执行;报告的 NMSE 是收敛预算运行的结果。
(c) 最终的能力谱:替换得到验证,一旦执行器足够强,有序执行得到验证,融合闭合得到验证(除非与其自身的对角约束对抗)。
当世界模型的内部状态不仅能被解码,更能被**使用**时,它才获得了物理诠释。近期工作将离散过渡码称为物理语言,训练触觉未来来塑造动作表征,并探测潜变量的质量、阻力和刚度(Shang et al. 2026 (https://arxiv.org/html/2608.19492#bib.bib17);Jin et al. 2026 (https://arxiv.org/html/2608.19492#bib.bib11);Tan et al. 2026 (https://arxiv.org/html/2608.19492#bib.bib19))。这些系统都基于同一个实际的赌注:一个紧凑的表征可以成为感知与干预之间的接口。**物理语言**这一短语增加了一个语义承诺:从声音推断出的词,当触觉替代声音时应保持其意义;由部分证据组装出的短语,在新的动作顺序下应仍能执行。通常的诊断回答的是更窄的问题。重建测试单个解码器。探针确立对某属性的访问。对齐将两个嵌入在空间上拉近。跨模态互换性最为接近,但它通常通过将模态训练到一个共享空间,然后在该空间中读取一致性来确立;而这种一致性可能源于共享目标,而非物理规律本身。这些单独都无法说明独立获取的证据指代的是同一个可观测的响应函数。跨模态互换性、函数表征和预测状态学习各自提供了那幅图景的一部分(Zhang et al. 2024 (https://arxiv.org/html/2608.19492#bib.bib22);Gondal et al. 2021 (https://arxiv.org/html/2608.19492#bib.bib8);Ingebrand et al. 2024 (https://arxiv.org/html/2608.19492#bib.bib10);Littman et al. 2001 (https://arxiv.org/html/2608.19492#bib.bib12))。我们需要一个测试,它将意义与表征**能执行什么**联系起来,然后确切地询问已建立了哪种能力。
我们的答案是**操作性的、查询相对的**。一个实体由其对一组已注册干预的响应来表示。一个冻结的执行器赋予模态坐标共享的语义。**DBOSC** 随后询问:在不相交的证据面板上独立训练、且没有跨模态匹配的独立编译器,在那些面板之外的响应上能否相互替换?相同实体的**一致性**必须优于错误实体的桥接和总体响应。这种设计将跨模态意义转化为一种**响应空间的测量**,而非几何类比。
图 1 (https://arxiv.org/html/2608.19492#S1.F1) 中的两个实验揭示了一个有用的分离。**Cluster Haptic** 提供了积极结果:音频和加速度在未知表面上编译到相同且特定于该表面的响应坐标,并且解封预留响应证实了该共享坐标是准确的,而非共同错误。一个精确控制的弹塑性系统则要求更高。它的两个模态具有互补的、可证明的盲区;响应轮廓是紧凑的;并且预留的响应强烈依赖于动作顺序。在那里,证书充当工具:它自身的先决条件拒绝了一个执行器训练不足的组合,同一个组合在执行器收敛后通过了验证,而更换执行器的分解方式则再次阻止了验证。结合一个不可辨识性构造,这些结果建立了一个实用的层级:属性访问、响应替换、融合闭合和有序执行是截然不同的成就。主要贡献是区分它们的证书、一个真实的装置替换结果,以及一项关于哪个组件提供有序执行能力的受控研究。
## 2 操作语义
### 2.1 响应等价赋予词语指称物
令 Ω 为一族物理实体,A* 为一组有限的干预程序。一个装置 α 固定了传感器、接触几何、初始条件和响应预处理。实体 ω 的**响应算子**定义为:
\(\mathcal{R}_{\omega}^{\alpha}(q) := \mathcal{L}\!\left(Y_{0:T}(q) \mid \operatorname{do}(q), \omega, \alpha\right), \quad q \in \mathcal{A}^{*},\)
其中 \(\mathcal{L}\) 是响应定律。对于已注册的查询族 \(\mathcal{Q}\),两个实体携带相同操作意义的条件是:
\(\omega \equiv_{\alpha,\mathcal{Q}} \omega' \Longleftrightarrow \mathcal{R}_{\omega}^{\alpha}(q) = \mathcal{R}_{\omega'}^{\alpha}(q) \quad \forall q \in \mathcal{Q}.\)
商空间 \(\Omega / \{\equiv_{\alpha,\mathcal{Q}}\}\) 是由该装置和查询族诱导的**词汇表**。它通过可执行和可观察的行为来区分实体。这个定义也明确了意义的单位:不是嵌入坐标,而是由已注册干预索引的**响应函数**。
一个模态编译器 \(C_{m,P}\) 将来自模态 m、面板 P 的证据 \(e_{m,P}\) 映射为一个响应坐标 θ 或坐标上的一个信念。一个共享执行器赋予该坐标以语义:
\[\![\![e_{m,P}]\!]\](q) = G\!\left(C_{m,P}(e_{m,P}), q\right).\]
执行器不接收任何模态、面板或实体标识符。因此,任何两个诱导出相同函数 \(q \mapsto [\![\![e_{m,P}]\!]\](q)\) 的编译器,对于该响应族都是可互换的。
### 2.2 能力阶梯
图 1 (https://arxiv.org/html/2608.19492#S1.F1) 组织了四个要求越来越高的主张。
*属性访问*询问一个潜变量是否承载一个可从原始证据中恢复的物理变量。
*响应替换*询问不同的传感器是否通过一个冻结的执行器诱导出相同的特定实体行为。
*融合闭合*询问互补的证据是否能改善执行的预测定律。
*有序执行*询问当熟悉的原语以未见的顺序出现时,该定律是否仍然有效。
每一步都改变了被测试的实证对象;在某一层的成功并不能自动为下一层提供捷径。表 eftab:capability-logic 说明了每个层级固定不变的内容。
### 2.3 词、融合与短语
当一个表征的感官来源可以互换而不改变冻结执行器的预测时,我们称其为一个**物理词**。对于 Cluster 表面,这个词既不是材料名,也不是嵌入聚类。它指代由已注册装置诱导的扫描-响应函数。作为信号,音频和加速度可能看起来无关;当独立编译器在超出两个证据面板的查询上恢复出相同的响应时,它们共享一个词。
**融合**涉及表征的另一种用法。它在一个共享图表中组合关于一个实体的不完整证据。成功的融合应改善图表执行的响应定律,而不仅仅是在坐标空间中缩小后验。因此,我们的测试固定实体、执行器和干预,只改变可用的证据。更窄的信念配上更差的响应实现了统计集中,但并未实现融合闭合。
**短语**增加了一个操作。在受控系统中,A 和 B 是熟悉的力脉冲,而 AB 和 BA 是由相同原语组装的程序。**塑性记忆**将第一个脉冲的效果带入第二个,因此颠倒顺序会改变最终响应。访问单个动作标记无法确定这个组合规则。**Oracle 检查**提供精确的实体坐标,并询问冻结执行器是否能将其携带通过未见的过渡。
留空遵循意义的单位。一个词级实验扣留实体,询问不同的传感器是否仍然选择其响应函数。一个短语级实验保持原语熟悉,但扣留连接它们的边。Cluster 为第一个问题提供了真实的感觉变异和广泛的响应网格。受控振荡器为第二个问题提供了精确的盲方向和物理记忆。它们共同区分了单一潜空间分数会混淆的两个主张。
### 2.4 为何该层级是严格的
###### 命题 1(压缩和信息融合不能识别组合)。
对观测查询的低秩响应压缩、来自每个模态的严格平方损失贝叶斯风险降低,以及融合下严格的后验迹缩减,都不足以识别(因此无法保证准确执行)一个未见的有序查询。
一个简短的构造使这种分离具体化。令观测到的原语响应为 \(\mathcal{R}(A) = U\) 和 \(\mathcal{R}(B) = V\),具有独立的高斯坐标 U、V,且令两个模态分别提供关于 U 和 V 的带噪声测量。观测到的响应表恰好是二维的。每个测量都降低了有序响应的贝叶斯风险,结合它们严格收缩了后验协方差。现在考虑两个物理系统,它们在每一个观测变量上都一致,但使用相反的组合定律:
\[\begin{aligned}
\mathcal{R}_{\sigma}(AB) &= U + V + \sigma\gamma UV, \\
\mathcal{R}_{\sigma}(BA) &= U + V - \sigma\gamma UV,
\end{aligned} \qquad \sigma \in \{-1, +1\}.\]
它们的证据和原语响应分布是相同的,而它们的**对易子**符号相反。因此,任何拟合到共同观测定律的学习器在两个系统中都必须返回相同的有序预测,并且至少在一个系统中出错。压缩和融合已经完成了它们的标称工作;未见的操作只是没有被这些工作所识别。附录 A (https://arxiv.org/html/2608.19492#A1) 提供了后验和风险计算。
## 3 操作证书
### 3.1 不相交-桥接算子-替换证书 (DBOSC)
DBOSC 将响应词汇的构建与多模态意义的测试分离开来。一个响应丰富的训练源定义了图表和执行器;两者随后被冻结。每个模态编译器从其自身的证据独立拟合,既没有匹配损失,也没有实体标识符。
令 P₀ 和 P₁ 为不相交的证据面板,令 \(\mathcal{Q}_{\mathrm{bridge}}\) 包含超出两个面板的响应查询。对于实体 i,分支 (m, P) 的解码响应为:
\(\widehat{\mathcal{R}}_{m,P}^{(i)} = \left[G(C_{m,P}(e_{i,m,P}), q)\right]_{q \in \mathcal{Q}_{\mathrm{bridge}}}.\)
我们通过训练实体间的变异来归一化响应距离:
\(D_{\mathcal{Q}_{\mathrm{bridge}}}(R, R') = \frac{\|R - R'\|_F^2}{Z}, \qquad Z = \frac{1}{N_{\mathrm{tr}}} \sum_{j=1}^{N_{\mathrm{tr}}} \|G_{\mathcal{Q}_{\mathrm{bridge}}}(\theta_j) - G_{\mathcal{Q}_{\mathrm{bridge}}}(0)\|_F^2.\)
对于一个包含 N 个实体的测试集,令 \(\mathcal{O} = \{(a, P_0; b, P_1), (a, P_1; b, P_0)\}\) 表示两种跨面板方向。有限估计量为:
\(D_{\mathrm{same}} = \frac{1}{2N} \sum_{i=1}^{N} \sum_{(u,v) \in \mathcal{O}} D_{\mathcal{Q}_{\mathrm{bridge}}}(\widehat{\mathcal{R}}_u^{(i)}, \widehat{\mathcal{R}}_v^{(i)}).\)
令 \(\mathcal{U}\) 包含四个模态-面板分支,并记 \(\bar{R} = G_{\mathcal{Q}_{\mathrm{bridge}}}(0)\)。两个控制量为:
\(D_{\mathrm{wrong}} = \frac{1}{2N(N-1)} \sum_{i \neq j} \sum_{(u,v) \in \mathcal{O}} D_{\mathcal{Q}_{\mathrm{bridge}}}(\widehat{\mathcal{R}}_u^{(i)}, \widehat{\mathcal{R}}_v^{(j)}),\)相似文章
合规、能力与冲突:系统消息下多模态LLM的基准测试
文章介绍了VSysBench,一个评估多模态大语言模型在系统消息下约束合规性与答案正确性的基准。研究发现系统消息降低了任务准确率,且开源权重模型与专有模型的合规表现存在差异。
一致性先于多样性:异构语言模型协调中的验证优先互补性
本文提出了Agreement-Before-Diversity(ABD)——一种用于异构语言模型集成的无标签决策规则,给出了理论恒等式,并在LiveCodeBench和GPQA-Diamond上取得了实证提升。
神经符号AI用于LEED合规:以文档为中心的基准测试、确定性数值检查以及多模态何时有害
本文介绍了一种神经符号流水线,用于自动化LEED v4.1 BD+C合规性验证,使用小型本地部署的语言模型和确定性数值检查。在四栋大学建筑上的实验表明,4B模型优于8B模型,确定性检查器纠正了关键得分点上的算术错误,尽管多模态输入会降低准确性。
语言塑造多语言大语言模型中指令层级遵循度
本文介绍了XIH-Bench,一个用于评估多语言大语言模型中指令层级遵循度的基准,揭示了语言依赖的不对称性以及语言边界效应,即跨语言冲突比同语言冲突产生更高的遵循度。
本体增强蒸馏与情境性审计用于主权企业语言模型:一种结合机制验证与负面结果方法的研究
本文结合了机制验证研究,针对主权企业语言模型的本体增强蒸馏以及一种情境性审计方法,使用了经过监督微调和DPO适配的Qwen3.6-27B学生模型。结果统计功效不足且为负面,显示未优于前沿基线,且路由中情境性为零。