将JEPA风格的预测学习应用于JA4衍生的网络指纹
摘要
本文探索将JEPA风格的预测学习应用于JA4衍生的网络指纹,构建了一个基于Transformer的模型(JA4-JEPA),该模型在JA4、JA4H、JA4S和JA4X子字段上进行训练。该模型在协议族分类任务上取得了优异表现,表明JEPA目标可以用于紧凑的网络指纹表示。
arXiv:2607.08465v1 公告类型:新
摘要:I-JEPA和V-JEPA通过将潜在预测与目标编码器输出匹配来学习,而不是重新生成原始输入,这种方法在图像和视频上效果良好。我们探索相同的目标是否适用于紧凑的网络指纹。我们构建了JA4-JEPA,一个基于Transformer的模型,在来自JA4DB和CIC-IDS-2017的JA4、JA4H、JA4S和JA4X子字段上进行训练。训练数据结合了来自两个来源的大约397K样本,但没有任何单个样本包含所有四个视图族。我们使用冻结的kNN探针在TLS、DNS和SSH的协议族分类上评估了学习到的表示。在39,416个保留样本上,模型实现了0.9899的余弦相似度和0.9220的kNN准确率。这些结果表明,即使不同来源的视图覆盖不完整,JEPA风格的预测学习也能从JA4衍生的指纹中产生有用的嵌入。
关键词:JA4, 网络指纹识别, JEPA, 预测表示学习, 自监督学习
查看缓存全文
缓存时间: 2026/07/10 06:08
# 将JEPA风格预测学习应用于JA4派生的网络指纹
来源:https://arxiv.org/html/2607.08465
Aygul Zagidullina 卢塞恩应用科学与艺术大学 (HSLU) aygul\.zagidullina@hslu\.ch
Javier Izquierdo 卢塞恩应用科学与艺术大学 (HSLU) javier\.izquierdo@stud\.hslu\.ch
###### 摘要
I-JEPA 和 V-JEPA 通过将潜在预测与目标编码器输出进行匹配,而非重构原始输入来学习,这种方法在图像和视频领域效果良好。我们探讨了同一目标是否适用于紧凑的网络指纹。我们构建了 JA4-JEPA,这是一个基于 Transformer 的模型,在来自 JA4DB 和 CIC-IDS-2017 的 JA4、JA4H、JA4S 和 JA4X 子字段上进行训练。训练数据结合了来自两个来源的大约 39.7 万样本,尽管没有一个单独的样本包含所有四个视图族。我们使用冻结的 kNN 探针在 TLS、DNS 和 SSH 的协议族分类上评估了学习到的表示。在 39,416 个保留样本上,模型实现了 0.9899 的余弦相似度和 0.9220 的 kNN 准确率。这些结果表明,即使来源之间的视图重叠不完整,JEPA 风格的预测学习也能从 JA4 派生的指纹中产生有用的嵌入。
关键词:JA4,网络指纹,JEPA,预测表示学习,自监督学习
## 1 引言
像 JA3 和 JA4 这样的网络指纹将协议握手的细节压缩成简短的标识符,这些标识符存储成本低且匹配速度快。然而,这些指纹大多用作静态查找键。它们本身并不能提供一种能够跨不同分析任务泛化的学习表示。
I-JEPA 和 V-JEPA 表明,在潜在空间中预测目标表示(而不是重构原始输入)可以从图像和视频中学习到强大的特征 (Assranet al.,2023 (https://arxiv.org/html/2607.08465#bib.bib7); Bardeset al.,2024 (https://arxiv.org/html/2607.08465#bib.bib8))。我们想知道相同的预测方法是否适用于一种非常不同类型的数据:源自 JA4+ 的紧凑网络指纹。
为了测试这一点,我们构建了 JA4-JEPA,这是一个基于 Transformer 的 JEPA 模型,在来自 JA4DB 和 CIC-IDS-2017 两个来源的 JA4、JA4H、JA4S 和 JA4X 子字段上进行训练。合并后的数据集包含大约 39.7 万个分词样本,但模态重叠不完整——没有一个单独的样本包含所有四个视图族,并且 JA4 通常是跨来源共享的唯一视图。
我们通过冻结的 kNN 探针在 TLS、DNS 和 SSH 的协议族分类上评估了学习到的表示。尽管训练数据中视图重叠不完整,该模型仍能在该任务上产生有用的嵌入。主要贡献如下:
- • 将 JEPA 风格的预测学习适应于 JA4 派生的网络指纹。
- • 一个混合来源的训练设置,覆盖 JA4、JA4H、JA4S 和 JA4X,其中样本间的模态覆盖各不相同,且无样本具有完整的视图重叠。
- • 评估表明,该模型的冻结嵌入支持对保留的 TLS、DNS 和 SSH 数据进行协议族分类。
- • 在包含 210 万对网关指纹对的生产试点语料库上进行匹配基线的异常基准测试,将预测能量信号与频率、最近邻、自编码器、重构和聚类基线进行比较,采用一种无泄漏协议,包括训练集大小扫描 (第4.5节 (https://arxiv.org/html/2607.08465#S4.SS5))。
这项工作的动机是实用的。标准指纹识别将每个签名视为一个查找键,而流级别或数据包级别的模型则需要更重的输入。一个从多个紧凑指纹视图中学习的模型可以处于一个有用的中间地带——输入轻量级,但比单签名匹配更丰富。
第2节 (https://arxiv.org/html/2607.08465#S2) 回顾了相关的指纹识别和表示学习工作。第3节 (https://arxiv.org/html/2607.08465#S3) 和第4节 (https://arxiv.org/html/2607.08465#S4) 描述了模型并报告了探针结果。第5节 (https://arxiv.org/html/2607.08465#S5) 讨论了这些结果支持什么以及仍然存在的差距。
## 2 相关工作
基于 TLS 的指纹识别有着悠久的实践历史。JA3 展示了 TLS 握手结构可用于识别客户端,但现实世界中 TLS 实现的多样性使得单个指纹变得脆弱,并且客户端可以故意且令人信服地模仿其他实现的 TLS 行为 (Frolov and Wustrow,2019 (https://arxiv.org/html/2607.08465#bib.bib1))。此外,像 QUIC 这样的协议完全绕过了经典的基于 TLS 的指纹识别。这些问题推动了更丰富指纹族的工作。
JA4+ 就是这样一个族。它定义了一组模块化的指纹,涵盖客户端 TLS、服务器 TLS、HTTP 行为和证书属性 (Althouse,2023 (https://arxiv.org/html/2607.08465#bib.bib2))。出于我们的目的,JA4+ 很有趣,因为它提供了同一连接的几个相关但结构不同的视图。这使其成为多视图表示学习的自然输入。
最近的网络流量分析工作开始将网络数据视为一个多视图问题。Gioacchini 等人表明,自监督多模态嵌入可以在参数更少的情况下,在网络分析任务上匹配或超越特征拼接 (Gioacchiniet al.,2024 (https://arxiv.org/html/2607.08465#bib.bib5)),而 Houidi 等人主张将网络数据视为多模态表示问题,而不是单一特征空间 (Houidiet al.,2022 (https://arxiv.org/html/2607.08465#bib.bib6))。我们的工作共享这种多视图的动机。主要区别在于训练目标:我们使用预测性潜在损失而不是重构或融合,并且我们的输入是具有不完整跨样本共现的紧凑 JA4 派生子字段。
我们的目标来自 JEPA 家族。在 I-JEPA 中,Assran 等人训练了一个图像模型,其中一个编码器看到一个上下文补丁,预测器试图匹配一个看到其他补丁的 EMA 目标编码器的输出 (Assranet al.,2023 (https://arxiv.org/html/2607.08465#bib.bib7))。Bardes 等人将相同的原理应用于视频,提出了 V-JEPA (Bardeset al.,2024 (https://arxiv.org/html/2607.08465#bib.bib8))。这两个模型都不试图重新生成原始输入。图像补丁和网络指纹显然是截然不同的数据,因此不能保证这种方法能够迁移。但底层目标——在学习的空间中匹配预测与目标——足够通用,似乎值得在结构化的指纹视图上尝试。
在网络方面,ET-BERT 表明,对加密流量字节序列进行自监督预训练可以改善下游分类 (Linet al.,2022 (https://arxiv.org/html/2607.08465#bib.bib9))。我们的设置不同之处在于,我们不建模原始数据包或流序列。相反,我们处理的是短的、分词的指纹视图,这些视图在来源之间具有不均匀的重叠。
据我们所知,没有先前的工作将 JEPA 风格的潜在预测应用于紧凑的协议指纹。最接近的工作线——字节序列预训练 (Linet al.,2022 (https://arxiv.org/html/2607.08465#bib.bib9)) 和多视图流量嵌入 (Gioacchiniet al.,2024 (https://arxiv.org/html/2607.08465#bib.bib5); Houidiet al.,2022 (https://arxiv.org/html/2607.08465#bib.bib6))——是基于重构或分类的。这就是本文要填补的空白。
## 3 方法
该模型使用 JEPA 训练目标:一个预测器网络试图匹配 EMA 更新的目标编码器在共享潜在空间中的输出,而无需重构原始输入。与先前 JEPA 工作的不同之处在于输入的内容:短的、分词的 JA4 派生指纹子字段,而不是图像补丁或视频帧。
### 3.1 数据与视图构建
上述合并的源数据集合并了 JA4DB111https://ja4db.com/(公共 JA4+ 指纹数据库)的记录与 CIC-IDS-2017 流量 (Sharafaldinet al.,2018 (https://arxiv.org/html/2607.08465#bib.bib4))。四个 JA4+ 族 (Althouse,2023 (https://arxiv.org/html/2607.08465#bib.bib2)) 细分为 13 个子字段:JA4\(a,b,c\)、JA4H\(a,b,c,d\)、JA4S\(a,b,c\) 和 JA4X\(a,b,c\)。JA4 存在于大多数样本中,并充当 HTTP 侧视图 (JA4H) 与服务器侧视图 (JA4S, JA4X) 之间的主要桥梁。每个子字段独立进行分词,使用基于最低频率阈值 2 构建的每个子字段词表。
数据集中的样本没有同时包含所有四个视图族,因此一些跨视图关系只能通过 JA4 间接学习。为了让模型在训练期间区分真实缺失的视图和故意隐藏的视图,缺失的模态用 PAD 标记编码,而掩码视图用 MASK 标记编码。图1 (https://arxiv.org/html/2607.08465#S3.F1) 展示了模型所看到的一个样本。
JA4abc | JA4Habcd | JA4Sabc | JA4X
--- | --- | --- | ---
TLS客户端 | HTTP行为 | 服务器TLS | PAD PAD PAD
证书 — 源端缺失 | 观察到的token | MASK: 训练中隐藏 | PAD: 源端缺失
图1: 模型所看到的一个样本:四个 JA4+ 视图中的 13 个分词子字段,每个都有自己的词表。源端从未产生的视图为 PAD;训练期间隐藏的视图为 MASK——模型学会区分缺失与隐藏。
### 3.2 预测架构
该架构包含三个部分:一个处理可见视图的上下文编码器,一个产生预测目标的 EMA 更新目标编码器,以及一个将上下文表示映射到目标空间的预测器。13 个子字段中的每一个都有其自己的 token 嵌入表。这些嵌入在馈送到编码器之前,与学习到的模态类型嵌入和位置嵌入相结合。`mixed_source` 配置使用一个 2 层、8 头的 Transformer,采用 CLS 池化,32 维的 token 嵌入,512 维的潜在空间,以及 512 的预测器隐藏层大小。
JA4, JA4H, JA4S, JA4X
子字段
→ 分词 + 模态标签
PAD用于缺失视图,MASK用于隐藏视图
上下文编码器(可见视图)
EMA目标编码器(目标视图)
预测器 + 掩码向量
目标潜在表示
JEPA潜在匹配损失
冻结编码器嵌入 → 协议族探针
→ → EMA
图2: JA4-JEPA 管道概览。子字段被分词并分为可见集和目标集。上下文编码器和预测器学习匹配目标编码器的潜在输出。训练后,冻结的编码器嵌入通过协议族 kNN 探针进行评估。
预测器接收池化的上下文表示以及一个二进制掩码向量,指示哪些子字段被隐藏。目标编码器与上下文编码器结构相同,但其权重通过指数移动平均更新,而非梯度下降。图2 (https://arxiv.org/html/2607.08465#S3.F2) 展示了完整的管道。
### 3.3 训练设置
损失函数是 JEPA MSE,在预测器输出和目标编码器输出之间计算。我们以批量大小 256 训练了 30 个 epoch,学习率为 \(2 \times 10^{-3}\),权重衰减为 0.04,3 个预热 epoch,EMA 衰减为 0.997。训练期间,单个子字段以 0.15 的概率被掩码,整个模态组以 0.30 的概率被掩码。测试集占数据集的 0.1。训练后,编码器权重被冻结,不进行任何监督微调。
## 4 结果
### 4.1 评估协议
我们使用三个指标评估冻结的编码器嵌入:预测表示与目标表示之间的余弦相似度、能量距离,以及基于余弦的 \(k\) 近邻探针(\(k=5\))。kNN 探针在保留测试集内使用 80/20 的参考-查询分割。由于数据集中的标签覆盖有限——CIC 派生的行仅带有良性 TLS 标签——我们专注于协议族分类(TLS vs. DNS vs. SSH),而不是更细粒度的任务,如应用识别。
表1: 本文使用的评估配置。
表1 (https://arxiv.org/html/2607.08465#S4.T1) 总结了两种配置。混合源配置是主要评估,因为它符合我们关于从部分重叠的 JA4 派生视图中学习的研究问题。仅 TLS 配置提供了额外的上下文,但使用了不同的类结构,因此我们不将其视为直接比较。
### 4.2 混合源探针结果
表2: 混合源配置结果。
混合源模型在覆盖 TLS、DNS 和 SSH 协议族的 39,416 个保留样本上实现了 0.9899 的余弦相似度和 0.9220 的 kNN 探针准确率 (表2 (https://arxiv.org/html/2607.08465#S4.T2))。高余弦一致性表明预测器很好地学习近似了目标编码器的输出。kNN 准确率表明,冻结的嵌入具有足够的结构,足以让简单的非参数分类器分离协议族。
### 4.3 掩码视图消融
表3: 混合源掩码视图消融。
隐藏任何单个视图族都会降低性能,但影响各不相同 (表3 (https://arxiv.org/html/2607.08465#S4.T3))。掩码 JA4H 或 JA4S 导致余弦一致性下降更大,能量距离增加更多,比掩码 JA4 或 JA4X 的影响更明显。这与数据集结构一致:JA4H 和 JA4S 覆盖了不同的协议级信息(分别是 HTTP 和服务器 TLS),而 JA4 已经是共享最广泛的视图。我们注意到,这些消融实验显示了在这个特定设置中的敏感性;它们并未建立哪个视图族最重要的通用排名。
### 4.4 仅 TLS 参考
一个使用 JA4、JA4S 和 JA4X 的独立仅 TLS 配置在 11,650 个保留样本上产生了 0.9932 的余弦均值和 0.7700 的二进制 kNN 准确率。由于这只使用了两个类别和不同的视图集,我们将其作为额外的上下文,表明预测设置在不同数据切片上也能工作,而不是与混合源结果进行匹配比较。
### 4.5 试点语料库上的匹配基线异常基准测试
在上述研究之后,该模型被重建为一个生产试点,应用于不同的语料库:来自企业网关遥测的 210 万个真实 (JA4, JA4H) 指纹对,仅两个视图。在该语料库上,我们进行了探针评估本身无法提供的匹配基线比较。所有方法在 40 万个样本上共享一个协议:基于完整对的内容哈希进行训练/验证/保留分割(训练集 320,105,保留集 39,990),因此保留的组合从未在训练中出现过,并且所有频率表和候选池仅从训练分割构建。
两个合成异常类别根据匹配的保留对进行评分。*Shuffle* 将真实的 JA4 与随机其他保留的 JA4H 配对;*hard-positive* 将真实的 JA4 与一个频繁出现但该对从未在训练中共现的 JA4H 配对——两部分各自常见,但组合新颖。这两个集合都不能包含真实观察到的对。JEPA 信号是两个掩码方向上的平均预测能量,这正好是部署服务返回的分数;单个方向作为消融(仅 JA4H 掩码:vs. shuffle 0.813,vs. hard-positive 0.860;仅 JA4 掩码:0.834 和 0.785)。
表4: 针对匹配保留对的异常检测 AUC,在 5% 假阳性预算下的阈值召回率,以及在试点语料库上的评分吞吐量。所有数字均来自共享协议下的跟踪运行。
参见标题
图3: 试点语料库上每种方法和异常类别的检测 AUC。JA4相似文章
SJEPA:学习具有混合符号-神经预测器的优雅潜在动力学
SJEPA 引入了一种无需重建的 JEPA 框架,学习混合符号-神经潜在动力学,旨在获得最简单且充分的预测表示。实验表明,与事后拟合相比,它能发现更简单的符号动力学,并具有更低的展开误差,同时在语法错误设定下控制符号-神经分配。
注解版JEPA
联合嵌入预测架构(JEPA)用于自监督学习的逐步注解实现与解释,涵盖I-JEPA、V-JEPA和LeJEPA。
JEPA 赋能 AI 原生 6G:预测表示与开放挑战
本文提供了关于在 6G 网络中使用联合嵌入预测架构(JEPA)进行自监督学习的教程,并附带一个波束管理案例研究和开放挑战。
我构建了Micro-JEPA:一个轻量级的JEPA(联合嵌入预测架构)Python实现
Micro-JEPA 是一个轻量级的JEPA(联合嵌入预测架构)Python实现,使智能体能够学习环境表征、在潜在空间中预测未来状态,并规划动作以避开障碍物。
无奖励的表征:JEPA对LLM微调的审计
本文对联合嵌入预测架构(JEPA)在自然语言到正则表达式任务上的LLM微调进行了审计,测试了二十二个辅助目标。结果表明,隐藏状态表征的改进与解码任务准确率之间仅存在弱耦合,没有辅助目标通过族系校正。