视觉-语言模型智能体间潜在通信的事后稀疏编码
摘要
本文通过将事后稀疏自编码器拟合到冻结的Vision Wormhole激活上,研究了视觉-语言模型智能体之间潜空间通信的可压缩性。结果表明,传输字节数减少了128倍,同时准确率损失极小,揭示了密集通信信道具有高度冗余性。
arXiv:2608.10198v1 公告类型:新
摘要:潜空间通信允许异构视觉-语言模型智能体在不将视觉和推理状态序列化为文本的情况下交换连续表示。Vision Wormhole通过将视觉特征转换为可被另一模型消费的通用潜表示来实现这一方法,但每条消息都以相同尺寸的稠密张量进行传输,无论其内容如何。因此,固定容量的稠密张量不一定具有固定的有效信息密度:某些消息可能仅使用可用表征自由度的一小部分。这一观察表明,通信信道可能是高度可压缩的。我们通过将事后稀疏自编码器拟合到冻结的Vision Wormhole激活上,并在九个推理基准上测量重建质量、下游效用、特征复用和token级干预,来研究其冗余性。相对于原始的float32传输,采用uint16索引/float16值的稀疏负载,每个token有k=4个活动系数,传输字节数减少了128倍。在单次运行评估中,七个非AIME任务的平均准确率从49.85%变为49.77%。拟合的4096元素字典仅使用了50个特征,任务级活跃集的平均成对Jaccard相似度为0.906。这些测量结果相对于原始传输确立了很强的事后可压缩性,但尚未将稀疏编码的增量贡献从位置选择、精度降低、低秩结构或SAE优化效果中分离出来。这些结果促使我们进行匹配负载的比较,以及设计其负载适应每条消息所用信息的通信机制。
查看缓存全文
缓存时间: 2026/08/12 08:21
# 视觉-语言模型智能体之间潜在通信的事后稀疏编码
来源: https://arxiv.org/html/2608.10198
吴迪 西交利物浦大学 Di\.Wu23@student\.xjtlu\.edu\.cn & 朱晓辉 西交利物浦大学 Xiaohui\.Zhu@xjtlu\.edu\.cn
###### 摘要
潜在空间通信允许异构视觉-语言模型智能体在不将视觉和推理状态序列化为文本的情况下交换连续表示。Vision Wormhole 通过将视觉特征转换为可被另一模型使用的通用潜在表示来实现这一方法,但每条消息无论其内容如何,都以相同大小的稠密张量进行传输。因此,固定容量的稠密张量未必具有固定的有效信息密度:某些消息可能只使用可用表示自由度的一小部分。这一观察表明,通信通道可能具有很大的可压缩性。我们通过将事后稀疏自编码器拟合到冻结的 Vision Wormhole 激活上,并在九个推理基准上测量重建、下游效用、特征复用和词元级干预,来研究其冗余性。相对于原始 float32 传输,每个词元具有 k=4 个活跃系数的 uint16 索引/float16 值稀疏载荷将传输字节数减少了 128×。在单次运行评估中,七个非 AIME 任务的平均准确率从 49.85% 变为 49.77%。拟合的 4096 元素字典仅使用 50 个特征,任务级活跃集合的平均成对 Jaccard 相似度为 0.906。这些测量确立了相对于原始传输的强事后可压缩性,但尚未将稀疏编码的增量贡献与位置选择、精度降低、低秩结构或 SAE 优化效应分离开来。这些结果促使我们进行匹配载荷比较,并设计载荷适应每条消息所使用信息的通信机制。
## 1 引言
协作式视觉-语言智能体必须在模型之间传达视觉观察和中间推理。自然语言消息提供了一种便捷的接口,但发送方需要先将连续的多模态状态序列化为离散文本,接收方才能对其采取行动。潜在空间通信通过直接交换连续表示来避免这种转换,从而保留了可能难以用语言表达的信息。
Vision Wormhole(Liu 等人,2026 (https://arxiv.org/html/2608.10198#bib.bib1))为异构智能体提供了一种实用解决方案。它使用视觉编码器和学习到的编解码器,将模型特定的视觉特征转换为通用潜在表示 U\_ref∈R^N×D,该表示可被注入不同的接收模型。这种设计实现了跨不兼容表示空间的直接通信,但其传输张量具有固定形状。因此,每条消息都使用相同的标称传输容量,即使其内容和信息需求不同。
然而,消息的信息需求会随其视觉内容、任务和推理阶段而变化。因此,固定容量的稠密张量未必具有固定的有效信息密度:某些消息可能只使用可用表示自由度的一小部分。我们并不声称直接估计香农熵。相反,我们提出一个操作性问题:稠密 Vision Wormhole 通道中有多少是重建其消息并保持其下游效用所必需的?回答这个问题是设计自适应或训练期通信机制之前的必要步骤。
我们通过将事后稀疏自编码器(SAE)训练在冻结的 Vision Wormhole 激活上来研究该通道。由于智能体和原始编解码器均未更新,SAE 揭示的是学习通道中已存在的结构,而不是在其训练期间施加稀疏性。我们将其既用作测量工具,也用作压缩器:稀疏重建测量有效表示冗余,任务准确率测试保留的结构是否对接收者仍然有用,特征分析则考察该结构是否随任务、词元角色和推理轮次而变化。
实验表明,原始稠密传输允许紧凑的事后编码,实现了 128× 的载荷减少,同时单次运行宏平均准确率几乎不变。进一步的特征分析表明,存在一个较小的、被广泛复用的支持集,以及依赖于词元角色的激活模式。
我们的贡献是:
1. 我们提出并实证研究了 Vision Wormhole 的固定形状潜在载荷与其通信通道所使用经验结构之间的不匹配。
2. 我们测量了相对于原始 float32 传输的端到端 128× 载荷减少,并在显式载荷核算假设下,在下游任务上测试了重建消息。
3. 我们刻画了事后 SAE 在九个任务上学到的支持集,量化了其规模和跨任务复用情况。
4. 我们分析了词元组干预,以区分共享特征支持与角色相关激活模式。
这些发现还促进了未来在匹配载荷基线、行为干预、跨配对验证以及具有消息相关稀疏预算的通信协议方面的工作。
## 2 相关工作
### 2.1 异构智能体之间的潜在通信
通信是多智能体系统中的核心设计选择。语言、工具调用和手工设计的离散协议易于在智能体之间路由,但它们将一个模型能通信的内容限制为可以显式序列化的内容。协作式多智能体强化学习中的学习通信则允许智能体开发可微或离散的协议,如 DIAL/RIAL 和涌现的接地语言(Foerster 等人,2016 (https://arxiv.org/html/2608.10198#bib.bib15);Mordatch 和 Abbeel,2018 (https://arxiv.org/html/2608.10198#bib.bib16))。对于异构视觉-语言模型,挑战更为尖锐,因为它们的内部视觉表示并不直接兼容。Vision Wormhole(Liu 等人,2026 (https://arxiv.org/html/2608.10198#bib.bib1))通过学习到的编解码器解决了这一问题,该编解码器将发送方的视觉隐藏状态映射为通用潜在表示,并将其注入接收方。它确立了潜在通信可以桥接异构模型。我们的研究询问由此产生的通道如何高效地使用其固定表示容量。
最近的工作还比较了语言模型智能体之间的文本、稠密潜在和 SAE 稀疏通道(Wenzel,2026 (https://arxiv.org/html/2608.10198#bib.bib2))。该研究侧重于通过文本序列化的信息存续以及跨架构潜在对齐,包括基于探针的评估。我们的设置是互补的:我们分析现有异构 VLM 通信编解码器产生的固定形状张量,以多种稀疏率重建它,并测量接收智能体的任务准确率。这种重叠使得匹配率基线和围绕 SAE 主张的仔细边界尤为重要。
### 2.2 高效与稀疏神经表示
这个问题将潜在智能体通信与关于高效神经表示的广泛文献联系起来。剪枝、量化、低秩近似和稀疏编码利用了参数或激活中的冗余(Zhou 等人,2016 (https://arxiv.org/html/2608.10198#bib.bib6);Frankle 和 Carbin,2019 (https://arxiv.org/html/2608.10198#bib.bib7);Dettmers 等人,2022 (https://arxiv.org/html/2608.10198#bib.bib8);Frantar 等人,2022 (https://arxiv.org/html/2608.10198#bib.bib9);Xiao 等人,2023 (https://arxiv.org/html/2608.10198#bib.bib10))。视觉变换器加速同样会移除或重新组织对预测贡献不大的视觉词元(Rao 等人,2021 (https://arxiv.org/html/2608.10198#bib.bib11);Liang 等人,2022 (https://arxiv.org/html/2608.10198#bib.bib12))。通信高效分布式学习通过稀疏化或量化梯度来减少网络流量,有时还会在优化轮次之间携带残差误差(Kairouz 等人,2021 (https://arxiv.org/html/2608.10198#bib.bib13);Lin 等人,2018 (https://arxiv.org/html/2608.10198#bib.bib14))。这些方法表明,稠密张量通常包含可去除的冗余,但它们的对象是模型、内部计算或优化更新。潜在智能体消息则不同:它是一种语义表示,被另一模型立即消费,因此保真度不仅需要通过张量重建来判断,还需要通过接收者的任务表现来判断。
稀疏自编码器提供了一种无需重新训练通信系统即可测量此类冗余的方法。它们将稠密神经激活分解为一小组活跃的字典特征,主要用于研究单个语言模型内部的表示(Bricken 等人,2023 (https://arxiv.org/html/2608.10198#bib.bib3);Cunningham 等人,2023 (https://arxiv.org/html/2608.10198#bib.bib4);Templeton 等人,2026 (https://arxiv.org/html/2608.10198#bib.bib5))。应用于 Vision Wormhole 时,同一技术探索的是两个模型之间的接口。所得特征提供了一种事后坐标系,用于测量支持集大小、跨任务复用以及不同词元组之间的差异。要将它们确立为通信原语,还需要它们在 SAE 种子之间具有稳定性,并能对接收者行为进行干预。
这一视角也与信息瓶颈有关,后者形式化了压缩与预测效用之间的权衡(Tishby 等人,2000 (https://arxiv.org/html/2608.10198#bib.bib17);Alemi 等人,2017 (https://arxiv.org/html/2608.10198#bib.bib18))。我们既不优化信息瓶颈目标,也不估计单条消息的熵。相反,我们测试 Vision Wormhole 的统一大小消息是否表现出比其稠密形状所暗示的更小的经验结构。通过结合重建、显式载荷核算、下游准确率、跨任务重叠和词元组干预,我们的分析考察了固定形状异构 VLM 通信张量中存在多少经验冗余。
## 3 事后稀疏通信分析
#### 通信设置。
我们分析 Vision Wormhole 通信张量 U\_ref,针对 Qwen3.5-9B↔LFM2.5-VL-1.6B 模型对。稠密表示包含 N=1026 个词元位置和 D=512 个维度,对应于 float32 下每轮通信约 2052 KB。根据编解码器实现,有效语义结构集中在 18 个词元位置:16 个语义词元、1 个全局词元、1 个风格词元。
#### 事后稀疏自编码器。
给定冻结的通信激活,我们训练一个字典大小为 M=4096 的稀疏自编码器。对于每个词元表示 u∈R^D,编码器产生稀疏系数 z=TopK(W_enc u, k),并重建 u^=W_dec z。SAE 独立于 Vision Wormhole 编解码器进行训练,因此梯度不会回流到任一智能体或通信编解码器。除非另有说明,主字典训练 50K 步,批量大小为 512,使用 Adam、从 10^−4 开始的余弦学习率衰减、AuxK 正则化,并在早期训练中进行死特征替换。
#### 评估任务。
我们收集激活并在九个基准上评估下游行为:GSM8K、ARC-Easy、ARC-Challenge、GPQA、MedQA、MBPP+、HumanEval+、AIME 2024 和 AIME 2025。每个基准问题由三个发送方角色处理——规划者、批评者和精炼者——每个角色产生一个 U\_ref 张量。因此,用于 SAE 分析的激活计数是通信张量的数量,而不是唯一基准问题的数量。例如,每个 AIME 子集中的 30 个问题产生 90 个通信张量。存储的激活文件为每个任务汇集了三个发送方角色。在定量平均准确率比较中,我们报告七个非 AIME 任务的均值,因为 AIME 子集非常小,且在我们的运行中稠密准确率为 0%。
#### 指标。
我们测量重建误差、余弦相似度、均方误差、带宽、压缩比和下游任务准确率。对于通信张量 U_i 及其重建 U^i,每个样本的相对重建误差为
e_i=√(mean[(U_i−U^i)^2]/(mean[U_i^2]+ε))≈∥U_i−U^i∥_F/∥U_i∥_F, ε=10^−8。
报告的重建误差是通信张量上的算术平均 1/S∑_{i=1}^S e_i,而 MSE 是对所有评估张量聚合的逐元素平方误差。余弦相似度在将每个通信张量展平后计算,然后对张量取平均。为了研究特征是任务特定的还是共享的,我们计算每个任务对的活跃特征索引集合之间的成对 Jaccard 相似度。
#### 词元级干预分析。
对于风格词元消融,我们使用 k=16、M=4096 的 SAE 对一批 50 个冻结通信张量进行编码,将词元位置 17 处的每个稀疏系数设为零,并解码干预后的表示。我们报告干预前后的张量级 MSE。我们还报告归一化风格能量比率
r_style=mean_{b,d} U_{b,17,d}^2 / mean_{b,n,d} U_{b,n,d}^2,
该比率将风格词元的均方幅度与张量级逐元素均值进行比较。这个归一化比率不是分配给风格词元的总张量能量比例。确切的聚合测量和工件来源在附录中报告。
#### 带宽核算。
稠密通信传输完整的 float32 张量,因此其载荷为
BW_dense=N·D·4 字节。
对于稀疏通信,每个活跃系数传输一个字典索引和一个系数值:
BW_sparse=N·k·(b_idx+b_val)。
由于 M=4096,字典索引需要 12 位。我们将其存储为 uint16,因此 b_idx=2 字节。除非另有说明,报告的稀疏带宽假定 float16 系数,b_val=2 字节,并排除固定数据包头或其他系统级元数据。例如,在 N=1026 且 k=4 时,稀疏传输成本为 1026×4×(2+2)=16,416 字节,即 16.0 KB,相对于原始 2052 KB 的 float32 稠密载荷产生 128× 的压缩。
该比率使用原始传输作为参考,不应单独归因于稀疏编码。特别是,以 float16 传输 18 个信息承载位置将需要 18×512×2=18,432 字节,大于稀疏载荷。相似文章
见我所见,知我所想:异构智能体间的密集潜在通信
本文提出一种利用对齐的KV缓存变换在异构多智能体系统间进行密集潜在通信的方法,相比基于文本的方法,性能更优且计算成本更低。
在应稀疏分解时稀疏分解,在应密集吸收时勿密集吸收
论文假设语言模型激活包含一个低秩密集分量,该分量被稀疏自编码器(SAEs)低效表示。通过添加一个线性瓶颈来吸收密集结构,作者减少了密集潜变量,并改进了在Gemma-2-2B上的稀疏探针性能。
Stateful Visual Encoders for Vision-Language Models
本文介绍了一种用于视觉-语言模型的有状态视觉编码器,该编码器基于先前的特征来调节视觉表示,从而在多图像和智能体设置中实现更好的视觉比较。该方法在跨图像空间聚合、纵向放射学等任务上展现出一致的改进。
VisCo:利用大语言模型作为视觉令牌压缩的内在编码器
VisCo是一个高效训练的自压缩框架,它重用预训练的视觉-语言模型作为视觉令牌压缩的内在编码器,在所有压缩比率下均实现优越性能,且无需外部模块。
使用稀疏自编码器解释与引导文本转语音语言模型
本文对CosyVoice3文本转语音语言模型应用稀疏自编码器,发现可解释的特征,这些特征可被引导以控制笑声、说话者性别和语速等属性,同时保留内容。