Applying JEPA-Style Predictive Learning to JA4-Derived Network Fingerprints

📄 arXiv: 2607.08465v1 📥 PDF

作者: Javier Izquierdo, Aygul Zagidullina

分类: cs.AI

发布日期: 2026-07-09


💡 一句话要点

提出JA4-JEPA以提升网络指纹的预测学习效果

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 网络指纹 预测学习 自监督学习 Transformer JA4

📋 核心要点

  1. 现有的网络指纹学习方法在处理不同视图重叠时效果不佳,难以生成有效的表示。
  2. 本文提出JA4-JEPA模型,通过Transformer架构实现对JA4派生网络指纹的预测学习。
  3. 实验结果显示,该模型在分类任务中取得了高达0.9220的准确率,验证了其有效性。

📝 摘要(中文)

I-JEPA和V-JEPA通过将潜在预测与目标编码器输出进行匹配,而非重建原始输入,已在图像和视频领域取得良好效果。本文探讨该方法是否适用于紧凑的网络指纹。我们构建了JA4-JEPA,这是一个基于Transformer的模型,训练数据来自JA4、JA4H、JA4S和JA4X四个子领域,结合了来自JA4DB和CIC-IDS-2017的约397K样本。评估结果显示,该模型在39,416个保留样本上实现了0.9899的余弦相似度和0.9220的kNN准确率,表明JEPA风格的预测学习能够从JA4派生的指纹中生成有用的嵌入,即使在源之间的视图重叠不完全的情况下。

🔬 方法详解

问题定义:本文旨在解决现有网络指纹学习方法在不同视图重叠情况下的表现不足,尤其是在处理紧凑网络指纹时的有效性问题。

核心思路:JA4-JEPA模型采用JEPA风格的预测学习,通过匹配潜在预测与目标编码器输出,避免了重建原始输入的复杂性,从而提高了学习效率和效果。

技术框架:该模型基于Transformer架构,训练数据来自JA4DB和CIC-IDS-2017,涵盖多个子领域。模型通过对397K样本进行训练,学习到有效的网络指纹表示。

关键创新:JA4-JEPA的主要创新在于将JEPA预测学习方法应用于网络指纹领域,显著提升了在不同视图重叠情况下的表示学习能力,与传统方法相比,具有更高的灵活性和适应性。

关键设计:模型的关键设计包括选择合适的损失函数以优化潜在预测与目标输出之间的匹配,采用Transformer结构以增强模型的表达能力,同时在训练过程中使用冻结的kNN探针进行评估。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

在39,416个保留样本上,JA4-JEPA模型实现了0.9899的余弦相似度和0.9220的kNN准确率,表明其在网络指纹表示学习中的优越性能。这些结果显著高于传统方法,验证了JEPA风格预测学习的有效性。

🎯 应用场景

该研究的潜在应用领域包括网络安全、入侵检测和流量分析等。通过有效的网络指纹学习,JA4-JEPA能够帮助识别和分类网络流量,提升网络监控和安全防护的能力,未来可能在实际网络环境中广泛应用。

📄 摘要(原文)

I-JEPA and V-JEPA learn by matching latent predictions to target encoder outputs rather than regenerating the original input, and this has worked well for images and video. We explore whether the same objective works for compact network fingerprints. We built JA4-JEPA, a Transformer-based model trained on JA4, JA4H, JA4S, and JA4X subfields drawn from JA4DB and CIC-IDS- 2017. The training data combines roughly 397K samples from both sources, though no single sample contains all four view families. We evaluated the learned representations with a frozen kNN probe on protocol-family classification across TLS, DNS, and SSH. On 39,416 heldout samples the model achieved a cosine similarity of 0.9899 and a kNN accuracy of 0.9220. These results indicate that JEPA-style predictive learning can produce useful embeddings from JA4-derived fingerprints, even with incomplete view overlap across sources. Keywords: JA4, network fingerprinting, JEPA, predictive representation learning, self-supervised learning