ResAware:通过资源特权蒸馏实现跨环境网站指纹识别

arXiv cs.LG 论文

摘要

ResAware提出了一种资源感知的蒸馏框架,通过训练基于资源级别特征的教师模型,并将知识蒸馏到仅使用加密流量的学生模型,从而提升不同网络环境下网站指纹识别的鲁棒性,在时间漂移和其他扰动下取得了显著的性能提升。

arXiv:2606.17462v1 公告类型:新 摘要:虽然网站指纹识别(WF)攻击在受控实验室环境中能达到高精度,但在现实环境中,由于时空漂移、浏览器异构性、代理混淆等原因,其性能通常显著下降。这一局限性源于它们完全依赖低层次的流量特征,而这些特征噪声大且对环境扰动高度敏感。为了解决这个问题,我们提出了基于{\bf ResAware}的跨环境资源感知蒸馏框架,该框架采用“训练丰富/推理贫乏”的非对称设置。具体而言,ResAware在资源级别特征上训练教师模型,然后通过异构知识蒸馏将得到的特权知识蒸馏到学生模型中。在部署时,学生模型仅使用加密流量进行推理,不产生额外成本。我们在一个大规模数据集上评估了ResAware,该数据集在五个月内从六个全球分布的观察点收集,包含超过$160{,}000$个配对样本。结果表明,ResAware显著增强了多种WF基线的跨环境鲁棒性。例如,在150天的时间漂移下,ResAware将Var-CNN的F1分数从$72.77\%$提升到$81.49\%$,开放世界下的$TPR@1\%FPR$从$22.40\%$提升到$27.20\%$。我们的结果表明,资源级别的监督在不扩大在线观测能力的情况下提高了WF鲁棒性。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:38

# ResAware:通过资源特权蒸馏实现跨环境网站指纹识别
来源:https://arxiv.org/html/2606.17462
Chongru Fan([email protected])(https://arxiv.org/html/2606.17462v1/mailto:[email protected])
北京邮电大学,北京,中国
中关村实验室,北京,中国
Wei Wang(中关村实验室,北京,中国)
Wentao Huang(北京邮电大学,北京,中国)
Zhenquan Ding([email protected])(https://arxiv.org/html/2606.17462v1/mailto:[email protected])
中关村实验室,北京,中国
Jinqiao Shi([email protected])(https://arxiv.org/html/2606.17462v1/mailto:[email protected])
北京邮电大学,北京,中国
Lei Cui(中关村实验室,北京,中国)
Zhiyu Hao(中关村实验室,北京,中国)
Xiaochun Yun(中关村实验室,北京,中国)

###### 摘要。尽管网站指纹识别(WF)攻击在受控实验室环境中取得了高准确率,但由于时空漂移、浏览器异构性、代理混淆等因素,在实际环境中其性能往往会大幅下降。这一局限性源于它们仅依赖低层流量特征,而这些特征噪声大且对环境扰动高度敏感。为解决此问题,我们提出ResAware,一个在“训练丰富/推理贫乏”不对称设置下的跨环境资源感知蒸馏框架。具体而言,ResAware在资源级特征上训练教师模型,然后通过异构知识蒸馏将得到的特权知识提炼到学生模型中。在部署时,学生模型仅使用加密流量进行推理,不产生额外成本。我们在一个跨越五个月、来自六个全球分布式观测点、包含超过160,000对配对样本的大规模数据集上评估了ResAware。结果表明,ResAware显著增强了多种WF基线方法的跨环境鲁棒性。例如,在150天的时间漂移下,ResAware将Var-CNN的F1分数从72.77%提升至81.49%,在1% FPR下的开放世界TPR从22.40%提升至27.20%。我们的结果表明,资源级监督能在不扩大在线观测能力的情况下提高WF的鲁棒性。
网站指纹识别,加密流量分析,知识蒸馏,跨环境鲁棒性
††ccs:网络 网络隐私与匿名性
††ccs:安全与隐私 假名性、匿名性与不可追踪性
††ccs:计算方法 机器学习算法

## 1. 引言

随着HTTPS及相关加密协议的广泛采用,网络流量的内容已基本无法直接审查(Rescorla等人,2025 (https://arxiv.org/html/2606.17462#bib.bib75);Hoffman和McManus,2018 (https://arxiv.org/html/2606.17462#bib.bib76))。然而,加密并未消除侧信道泄漏:可观测的流量模式(如数据包长度、方向和时间)仍可能泄露用户活动的敏感信息。网站指纹识别(WF)利用这种泄漏从加密流量轨迹中推断出访问的网站(Hintz,2002 (https://arxiv.org/html/2606.17462#bib.bib77);Hayes和Danezis,2016 (https://arxiv.org/html/2606.17462#bib.bib55);Wang等人,2014 (https://arxiv.org/html/2606.17462#bib.bib64)),因此对加密网络通信构成重要的隐私威胁。

参考说明
图1. 一个网站的身份体现在其架构和资源加载模式中。一次浏览实例可以视为一系列资源交付,这些资源在环境噪声影响下表现为可观测的网络流量。
图示说明:网站的静态资源依赖拓扑生成稳定的应用层资源序列,然后映射到加密流量轨迹。ResAware将资源序列作为特权离线监督,同时保持在线攻击者仅能访问加密流量。

尽管基于深度学习的WF模型在封闭、独立同分布(IID)的实验环境中取得了优异性能(Sirinam等人,2018 (https://arxiv.org/html/2606.17462#bib.bib58);Bhat等人,2019 (https://arxiv.org/html/2606.17462#bib.bib68);Rahman等人,2020 (https://arxiv.org/html/2606.17462#bib.bib19);Deng等人,2025a (https://arxiv.org/html/2606.17462#bib.bib28)),但在实验室场景与现实网络环境之间仍存在显著的部署差距。在实践中,流量特征极易受到时间演变、地理变化和混淆代理协议转换的影响,所有这些都会导致显著的分布偏移(Cherubin等人,2022 (https://arxiv.org/html/2606.17462#bib.bib13);Deng等人,2025b (https://arxiv.org/html/2606.17462#bib.bib1);Li等人,2025 (https://arxiv.org/html/2606.17462#bib.bib23);Shusterman等人,2026 (https://arxiv.org/html/2606.17462#bib.bib21))。当模型在一个环境中训练,而在另一个特征差异显著的环境中评估时,主流WF模型的准确率会大幅下降。这种退化表明现有模型严重依赖于瞬时的、环境特定的网络伪影,因此跨环境泛化能力较差。

先前缓解该问题的工作通常遵循两条路径。第一条通过手工特征工程、数据增强或对比学习寻求更鲁棒的流量表示(Shen等人,2023 (https://arxiv.org/html/2606.17462#bib.bib20);Bahramali等人,2023 (https://arxiv.org/html/2606.17462#bib.bib33);Xie等人,2024 (https://arxiv.org/html/2606.17462#bib.bib31))。第二条采用领域自适应,例如在未标注的目标流量上进行小样本微调或推理时校准(Sirinam等人,2019 (https://arxiv.org/html/2606.17462#bib.bib29);Deng等人,2026 (https://arxiv.org/html/2606.17462#bib.bib14);Zhang等人,2023 (https://arxiv.org/html/2606.17462#bib.bib74))。尽管付出了这些努力,现有方法仍局限于仅基于流量的观测视角:训练和推理都只依赖从加密流量中提取的信号。这些信号容易被网络变化、浏览器调度和协议封装所扭曲。因此,当前方法试图从不稳定的观测中恢复网站身份,却忽视了产生这些流量模式的确定性应用层资源。

如图1 (https://arxiv.org/html/2606.17462#S1.F1)所示,我们的关键洞察是:一个网站的身份决定了其应用层的资源组成和依赖模式(Wang等人,2013 (https://arxiv.org/html/2606.17462#bib.bib78);Netravali等人,2016 (https://arxiv.org/html/2606.17462#bib.bib79))。在页面加载过程中,最终的资源序列反映了相对稳定的特定网站加载逻辑。相比之下,观测到的网络流量只是该过程的一个有噪声的投影,受到大量随机性和环境变化的影响(Juarez等人,2014 (https://arxiv.org/html/2606.17462#bib.bib80))。最近的资源感知WF研究表明,资源级信息在跨环境设置中天然具有鲁棒性优势(Cheng等人,2025b (https://arxiv.org/html/2606.17462#bib.bib15);Gao等人,2025 (https://arxiv.org/html/2606.17462#bib.bib26);Cheng等人,2025a (https://arxiv.org/html/2606.17462#bib.bib11))。然而,在实践中获取此类信息通常需要解密流量或端主机入侵,这两者都超出了标准被动窃听者的能力(Panchenko等人,2016b (https://arxiv.org/html/2606.17462#bib.bib81))。

为了利用资源级稳定性而不扩大在线攻击面,我们将一种不对称威胁设置形式化,称为“训练丰富/推理贫乏”。在离线指纹数据库构建期间,攻击者可以使用受控爬虫收集加密流量和资源级信息;在在线推理期间,攻击者仍然是标准被动窃听者,仅能访问加密流量。在此设置下,资源级信息在训练时可用,但在在线推理时不可用,因此自然符合特权信息(Privileged Information)的定义(Vapnik和Izmailov,2015 (https://arxiv.org/html/2606.17462#bib.bib67)):一种辅助监督信号,在训练时指导学习,但在推理时不能作为输入。

受“利用特权信息学习”(LUPI)范式(Vapnik和Izmailov,2015 (https://arxiv.org/html/2606.17462#bib.bib67);Lopez-Paz等人,2016 (https://arxiv.org/html/2606.17462#bib.bib66))的启发,我们提出ResAware,一个在“训练丰富/推理贫乏”设置下用于跨环境WF的资源感知蒸馏框架。利用配对的流量-资源样本,ResAware在资源级特征上训练一个资源侧教师模型,并通过跨模态知识蒸馏(Hinton等人,2015 (https://arxiv.org/html/2606.17462#bib.bib71);Lopez-Paz等人,2016 (https://arxiv.org/html/2606.17462#bib.bib66))将获得的特权知识提炼到学生模型中。学生模型仅处理加密流量。在部署时,资源序列和教师模型被移除,留下一个标准的仅基于流量的WF分类器。通过这种方式,ResAware在不增强在线攻击者能力(仍为标准被动威胁模型)的前提下提高了鲁棒性。

我们在多维分布偏移下评估ResAware,包括时间、空间、浏览器和代理变化,基于一个跨越五个月、六个全球分布式节点、超过16万个样本的大规模数据集。结果表明,ResAware鲁棒地提升了主流WF基线方法的跨环境泛化能力,且推理开销为零。此外,ResAware与现有的目标域自适应技术(Sirinam等人,2019 (https://arxiv.org/html/2606.17462#bib.bib29);Deng等人,2026 (https://arxiv.org/html/2606.17462#bib.bib14);Zhang等人,2023 (https://arxiv.org/html/2606.17462#bib.bib74))是正交互补的。

本文的主要贡献如下:
- •**不对称威胁模型形式化**。我们引入并形式化了WF的“训练丰富/推理贫乏”不对称设置。在此设置下,应用层资源信息仅在训练时可用,自然充当特权信息,提高了仅基于流量的WF模型的鲁棒性,同时保持标准被动窃听者假设。
- •**跨模态蒸馏框架**。我们提出ResAware,一个用于跨环境WF的跨模态知识蒸馏框架。ResAware在资源级特征上训练资源侧教师模型,并将获得的特权知识提炼到仅基于流量的学生模型中,在不需推理时访问资源的情况下注入稳定的资源侧监督。
- •**即插即用集成,零推理开销**。ResAware可以仅通过训练目标集成到现有WF模型中,无需修改骨干架构。在部署时,它直接对加密流量进行操作,零额外推理开销,并且与现有领域自适应技术互补。
- •**大规模基准评估**。我们构建了一个跨越多个跨环境场景的大规模配对流量-资源数据集。在该基准上,ResAware鲁棒地提升了主流WF基线方法的鲁棒性。在150天的时间漂移下,它将Var-CNN的F1分数从72.77%提升至81.49%,在1% FPR下将开放世界TPR从22.40%提升至27.20%。在更具挑战性的混淆代理漂移设置下,它进一步为Var-CNN和RF分别带来了8.96%和3.88%的绝对F1分数提升。

## 2. 威胁模型

参考说明
图2. “训练丰富/推理贫乏”不对称威胁模型。在离线构建阶段,攻击者通过TLS密钥记录收集配对流量和资源序列;在在线推理阶段,仅能观测到加密流量。
两阶段图示:离线构建阶段,攻击者通过TLS密钥记录收集配对流量和资源序列;在线推理阶段,攻击者为被动窃听者,仅观测加密数据包级流量。

如图2 (https://arxiv.org/html/2606.17462#S2.F2)所示,我们将跨环境WF的一种不对称威胁模型形式化,称为“训练丰富/推理贫乏”。不对称性在于:资源级信息在离线训练时可用,但在在线推理时不可用。

**离线构建阶段**。如图2 (https://arxiv.org/html/2606.17462#S2.F2)上半部分所示,攻击者在受控环境中部署仪表化爬虫访问网站,同时收集加密流量和相应的TLS密钥日志。这些密钥日志仅由攻击者控制的爬虫在离线数据收集期间生成,在在线推理时无法从受害者处获取。这使得能够离线解析加密流量并提取高保真的应用层资源信息,这些信息仅作为训练时的特权监督。

**在线推理阶段**。图2 (https://arxiv.org/html/2606.17462#S2.F2)下半部分描述了在线攻击者作为客户端路径上的观察者,例如本地自治系统(AS)、互联网服务提供商(ISP)或恶意的本地路由器。攻击者只能被动观测受害者加密连接的数据包级特征,包括数据包方向、长度和时间。攻击者无法解密载荷、无法注入、修改、延迟或丢弃数据包,也无法控制受害者的端点。我们进一步排除了可能直接泄露目标网站的侧信道元数据,包括DNS查询、TLS SNI字段、证书内容、HTTP Host头、IP到域名的映射以及浏览器端API指纹。与主流的页面加载级WF研究一致(Cheng等人,2025a (https://arxiv.org/html/2606.17462#bib.bib11);Sirinam等人,2018 (https://arxiv.org/html/2606.17462#bib.bib58);Huang等人,2023 (https://arxiv.org/html/2606.17462#bib.bib82)),我们假设每个测试样本对应一个孤立的页面加载事件。

## 3. 动机分析:资源级特征的稳定性与可迁移性

为引出ResAware,我们探究两个基本问题:
(1) **资源级特征鲁棒性**:资源级特征在跨环境分布偏移下是否稳定且具有判别性?
(2) **知识可迁移性**:从离线资源级信息中获取的知识能否被有效蒸馏到仅基于流量的学生模型中?

### 3.1. 资源级特征在跨环境中是否稳定且具有判别性?

现代网页加载遵循一个由HTML、CSS、JavaScript和异步资源获取构成的结构化过程(Fielding等人,2022 (https://arxiv.org/html/2606.17462#bib.bib83))。尽管动态更新、广告注入和A/B测试可能引入局部变化,但一个网站的整体资源加载序列通常在不同访问间保持稳定的宏观模式(Li等人,2023 (https://arxiv.org/html/2606.17462#bib.bib84);Panchenko等人,2016a (https://arxiv.org/html/2606.17462#bib.bib85))。相比之下,低层流量特征(如数据包长度、方向和数据突发)......

相似文章

通过追踪重写保护语言模型免受未授权蒸馏

arXiv cs.CL

本文提出了通过重写推理追踪来保护大型语言模型免受未授权知识蒸馏的方法,该方法在保持正确性的同时降低训练价值,并在蒸馏的学生模型中嵌入可验证的水印。该方案采用基于指令和基于梯度的重写技术来实现反蒸馏效果,同时不影响教师模型性能。