基于领域自适应Sentence Transformers的云安全合规性自动映射
摘要
本文提出对Sentence Transformer模型进行领域自适应,以自动映射云安全控制与技术指标之间的关系,在控制到指标以及跨标准关联任务上,相比零样本基线取得了显著的性能提升。
arXiv:2607.06364v1 公告类型: 新
摘要: 将云安全控制映射到技术指标目前是一个手动过程。本文提出对Sentence Transformer模型进行领域自适应以实现自动化。我们构建了一个包含来自五个欧洲安全标准的3,499个语义对(每个对连接安全控制与技术指标)的训练语料库,然后通过回译和基于LLM的改写将其扩展到四个场景中多达13,996个样本。我们微调了五种架构,并在两个独立任务上评估其性能:控制到指标映射和跨标准控制关联。所有微调模型均优于其零样本基线。在控制到指标任务上,最佳模型在nDCG@10上提升了高达23个点,而在跨标准控制任务上,\textit{multi-qa-mpnet-dot-v1}在回译条件下达到了0.870 nDCG@10。结果表明,在所考虑的案例研究中,领域内训练数据是性能的主要驱动因素。
查看缓存全文
缓存时间: 2026/07/08 04:42
# 基于领域自适应句子嵌入的云安全自动化合规映射
来源:https://arxiv.org/html/2607.06364
Luca Petrillo¹, Fabio Martinelli, Marinella Petrocchi
¹ 共同第一作者。
信息与通信技术研究所(IIT-CNR),意大利比萨
IMT 卢卡高等研究院,意大利卢卡
高性能计算与网络研究所(ICAR-CNR),意大利伦德(CS)
###### 摘要
目前,将云安全控制映射到技术指标是一个人工过程。本文提出对句子嵌入模型进行领域自适应以自动化该过程。我们构建了一个包含来自五个欧洲安全标准及一组技术指标的 3,499 个语义对的训练语料库,然后通过反向翻译和基于大语言模型的释义将其扩展至四种场景下最多 13,996 个样本。我们对五种架构进行微调,并在两个独立任务上评估其性能:控制-指标映射和跨标准控制关联。所有微调模型均优于其零样本基线。在控制-指标任务上,最佳模型 nDCG@10 提升高达 23 个点;在跨标准控制任务上,经过反向翻译的 multi-qa-mpnet-dot-v1 达到了 0.870 的 nDCG@10。结果表明,领域内训练数据是所研究案例性能的主要驱动因素。
###### 关键词:
云安全;EUCS;自动法规合规;句子嵌入;自然语言处理;微调;数据增强
## 1 引言
欧洲的云服务提供商(CSPs)处于不断变化的监管环境中。欧洲云服务网络安全认证计划(EUCS)[ENISA2020]旨在用一个统一框架取代分散的国家标准。虽然这种统一增强了安全性,但也给提供商带来了沉重的合规负担。为了获得认证,CSPs 必须证明其技术运营满足高级法律要求。这个过程依赖于技术证据,我们称之为**指标**。指标支持对抽象规范性文本(我们称之为**控制**)的评估。
目前,控制与指标之间的映射由专家手动完成。这个过程缓慢、成本高昂且容易出错。标准的持续演变(例如,从 BSI C5 到 EUCS 的过渡[BSIc5])意味着组织必须反复进行这些映射,造成了可扩展性瓶颈。现有的合规自动化方法存在明显差距。相关工作主要集中在结构化格式上,而跨标准映射和合规推理仍严重依赖手动建模和基于规则的方法,通常需要手工制作的本体或元模型,这些方法对于控制的重新措辞很脆弱[castellanos2022compliance]。与此同时,基于句子嵌入的语义相似度模型在通用文本上表现良好,但它们并未专门针对云安全语言进行训练,也未在控制-指标和控制-控制匹配任务上进行系统评估。
在我们之前的工作[emerald1, emerald2]中,我们探索了使用预训练的句子嵌入(SBERT)将控制匹配到指标。该研究依赖于对云安全术语没有先验知识的通用模型。虽然结果显示出潜力(nDCG₁₀=0.640),但性能仍然有限,很可能是由于缺乏领域特定知识。本文通过微调进行领域自适应,采用以数据为中心的方法进行云合规匹配,以解决这一差距。具体来说,本研究的主要贡献如下:
- 1. 我们引入了一个特定于云合规的训练语料库,通过整合异构标准(BSI C5、ENS、SecNumCloud、EUCS),并通过一个通用参考框架(Cisco CCF)将它们与 EMERALD 欧盟项目[emeraldProject]开发的指标相关联。
- 2. 我们在此语料库上微调句子嵌入模型,以支持云安全合规中的控制-指标和控制-控制匹配任务。
- 3. 我们研究了包括反向翻译和基于大语言模型的释义在内的数据增强策略在四种训练场景下的影响。
- 4. 我们证明领域自适应模型的性能优于通用基线,展示了领域特定知识对于自动化合规映射的重要性。
## 2 相关工作
自然语言处理在法规合规方面的应用已在多个场景中得到探索。Chalkidis 等人[chalkidis2021regulatory]将跨立法对齐视为欧盟和英国法规上的文档检索问题,表明当表面文本相似性较弱时,领域内微调优于基于词汇的检索基线。文献[ciaramella2025leveraging]利用预训练的 Transformer 模型来确定隐私政策是否符合 GDPR 第 13(2)(b) 条规定的单一义务,即是否告知数据主体其更正或删除个人数据的权利。Amaral 等人[cejas2023nlp]应用 NLP 自动检查数据处理协议是否符合 GDPR 要求,针对法律授权与操作工件之间的语义差距。Carello 等人[carello2024study]使用半自动化 NLP 技术将网络安全控制映射到漏洞目录,证实了规范文本与技术文本之间的词汇不匹配仍然是安全领域的一个开放问题。在文献[agarwal2021ai]中,Agarwal 等人使用微调后的 Transformer 模型将法规控制映射到 NIST 800-53(最佳方法:层次分类,在 1,580→826 个映射上 Recall@K)。在文献[ahmed2024prompting]中,Ahmed 等人通过少量示例的大语言模型提示将互联网安全中心(CIS)关键安全控制转化为措施/指标,并通过大语言模型作为评判者的相关性进行评估。与这两者不同,我们针对欧盟计划(EUCS、BSI C5、ENS、SecNumCloud),并联合处理控制-控制和控制-指标检索,使用领域自适应的句子嵌入。
在我们之前的工作[emerald1, emerald2]中,我们在零样本设置下评估了预训练句子嵌入在云安全控制与指标关联方面的表现。我们发现,没有领域知识时,通用模型表现一般。基于此研究,本研究从各种欧洲标准构建了一个带标签的训练语料库,并使用反向翻译和基于大语言模型的释义作为增强策略。我们还考察了在四种训练配置下微调的影响。
## 3 数据源
我们从六个来源构建知识库。这些来源涵盖三个维度:通过中心枢纽的结构化关联、通过指标目录的技术特异性以及通过国家标准的语言多样性。另外两个数据集——MEDINA 指标目录和 EUCS-Legacy 控制快照——仅保留用于评估目的,在第 5.3 节(https://arxiv.org/html/2607.06364#S5.SS3)中有描述。
##### Cisco 云控制框架
Cisco 云控制框架(CCF)v2.0[ciscoCCF]是一个公开可用的框架,它将包括 ISO 27001¹ 和 SOC 2² 在内的国际和国家安全合规与认证要求汇总到一个统一的资源中。它提供了一种结构化方法来管理云安全控制并监控其在云基础设施部署中的有效性。CCF 包含多个控制域,包括身份和访问管理、数据保护、事件响应和漏洞管理。每个域包含组织可根据其风险状况和监管要求实施的特定控制。
¹ ISO/IEC 27001 – 信息安全管理系统标准:https://www.iso.org/standard/27001
² 服务组织控制 2 – 安全性、可用性和机密性的信任服务标准:https://www.aicpa-cima.com/topic/audit-assurance/audit-and-assurance-greater-than-soc-2
##### 云计算合规标准目录
云计算合规标准目录(BSI C5)[BSIc5]由德国联邦信息安全办公室制定,是一套专门用于评估云服务提供商的安全与合规标准。该目录旨在建立云提供商必须遵守的最低安全标准和需求,以确保云环境中敏感数据和关键基础设施的保护。它特别涵盖了十三个主要控制领域,包括信息安全管理系统、身份与访问管理、加密与密钥管理,每个领域都包含云服务提供商为获得认证必须满足的详细标准和需求。在本研究中,它作为我们知识库中的一个结构桥梁,因为它是唯一一个同时具有到 CCF 和 EMERALD 操作指标原生映射的来源,这连接了规范性要求与技术证据。
##### 国家安全框架
国家安全框架(ENS)[spanishENS]是西班牙的一个监管框架,为西班牙公共实体处理的信息安全建立原则和要求,旨在确保信息系统和数据的安全。它基于 CIA 三元组(机密性、完整性和可用性),并强制要求采用基于风险的方法,要求组织进行安全评估以实施相称的安全控制。
##### SecNumCloud
SecNumCloud(v3.2)[secnumcloud]是由法国国家网络安全局(ANSSI)³ 制定的法国国家云安全认证框架。它定义了云服务提供商在处理敏感数据(特别是针对公共部门和关键用例)时必须遵守的严格安全、合规和数据主权要求。该框架适用于在欧洲管辖范围内提供服务的提供商,确保防范域外法律,并提供强有力的数据主权保障,通常涉及位于法国或欧盟境内的基础设施。
³ https://cyber.gouv.fr
##### EUCS 候选方案
欧洲云服务网络安全认证计划(EUCS)(草案版本 v2020[ENISA2020])是一个拟议框架,旨在标准化整个欧盟的网络安全认证,以协调国家认证计划、安全和治理标准,适用于云服务提供商。
##### 控制与指标仓库
Horizon Europe EMERALD 项目[emeraldProject]正在开发一个用于持续云认证即服务的证据管理平台。这包括一个控制与指标仓库,用于评估对前述计划等框架的合规情况。安全指标涵盖多个领域,包括传输加密、TLS 相关指标、密码指标和反恶意软件扫描频率。
## 4 问题定义
我们将不同标准之间以及控制与指标之间的关联形式定义为一个开放域信息检索问题。这里关键词搜索是不够的,因为控制与指标以及不同标准中的控制之间的词汇和抽象级别不同。一个技术指标如“OPS-05.3H:已启用反恶意软件”和一个规范性控制如“CSP 应在所有计算节点上部署恶意软件检测机制”用非常不同的术语表达了相同的需求。
令 \( \mathcal{Q} \) 为查询集,\( \mathcal{D} \) 为文档集。我们的系统以一个控制作为输入,因此一个查询 \( q \in \mathcal{Q} \) 总是一个控制。相反,文档列表 \( d \in \mathcal{D} \) 表示要检索的目标工件,可以是目标方案(例如 EUCS)中的控制,也可以是技术指标。
目标是学习一个相似度函数 \( f(q, d) \rightarrow \mathbb{R} \)(其中 \( \mathbb{R} \) 是表示相似度分数的实数集),用于对一组候选文档进行评分。给定一个查询 \( q \),系统应用 \( f \) 产生一个按相似度分数降序排列的文档列表 \( d \in \mathcal{D} \),使得语义上满足 \( q \) 的文档排在列表顶部。
我们使用基于句子嵌入的双编码器来参数化 \( f \),该编码器将 \( q \) 和 \( d \) 独立地映射到一个共享向量空间:
\[
f(q, d) = \cos(\mathbf{u}, \mathbf{v}) = \frac{\mathbf{u} \cdot \mathbf{v}}{\|\mathbf{u}\| \|\mathbf{v}\|} \tag{1}
\]
其中 \( \mathbf{u} \) 和 \( \mathbf{v} \) 分别是从 \( q \) 和 \( d \) 提取的嵌入。
该模型评估输入文本对 \( (q, d) \) 并输出标量相似度分数,而不内置文本是代表指标还是控制的概念。虽然系统的最终输出是一个排序列表,但底层函数是在成对数据上操作的,学习到某些对是语义相关的,而其他对则不是。单一公式允许控制-控制对和控制-指标对贡献到同一个学习目标,从而形成一个更大、更统一的训练语料库。它还消除了为每个任务维护单独模型的需要,降低了工程复杂性,并使系统更容易扩展到新标准。因此,这个公式覆盖了两个任务。在**控制-控制关联**中,查询是来自一个框架的控制,目标是检索来自另一个框架的语义等价控制(例如,从 CCF 中的控制到 EUCS 中的控制)。在**控制-指标关联**中,查询是一个控制,目标是以技术方式检索该控制所体现的指标。
## 5 方法
预训练的通用模型在专业监管文本上可能表现不佳[emerald1, emerald2]。为了解决这个问题,我们采用了一个三阶段的领域自适应流水线。首先,我们从知识库构建一个语义对语料库。其次,我们通过数据增强扩展这个语料库。然后,我们使用对比学习目标[gao2021simcse]对编码器进行微调。给定一个查询 \( q \),令 \( d^+ \) 表示一个相关(正例)文档,\( d^- \) 表示一个不相关(负例)文档。该目标鼓励 \( (q, d^+) \) 的表示在嵌入空间中接近,同时将 \( (q, d^-) \) 推得更远。
### 5.1 训练语料库构建
我们构建了一个带标签的锚点-目标对数据集,其中每个对将一个框架中的控制与另一个框架中语义等价的控制(或指标)相关联。该数据集来自第 3 节描述的公开文档化框架,使用两种不同的策略。
#### 5.1.1 语义对提取
##### 策略 I:通过 Cisco CCF 进行控制-控制关联
如第 3 节(https://arxiv.org/html/2607.06364#S3.SS0.SSS0.Px1)所述,Cisco CCF 充当各种国际和国家安全合规要求的中心枢纽,并且还被设计为提供跨框架映射。特别是,ENS、BSI C5 和 SecNumCloud 都有到 CCF 的映射,因此我们也可以利用它来推导这三个方案之间的映射。
由于 ENS 和 SecNumCloud 以其源语言(西班牙语和法语)的未结构化 PDF 形式分发,我们使用 pdfplumber⁴ 从这些文档中提取文本,然后使用 DeepL API⁵ 将其翻译成英语。
⁴ https://github.com/jsvine/pdfplumber
⁵ https://www.deepl.com/pro-api
由于 Cisco CCF 数据集包含指示哪些相似文章
基于Transformer的语言模型在垂直领域中的应用:架构、应用与批判性评估
对基于Transformer的语言模型的全面综述,涵盖架构、在医疗、金融、法律等垂直领域的应用,以及对计算成本、对齐和数据来源等权衡因素的批判性评估。
通过Transformer揭示UTM安全关键场景
本研究论文提出了一种基于Transformer的强化学习框架,用于自动生成无人交通管理(UTM)系统的安全关键测试场景,在漏洞发现效率上比专家引导测试提高了8倍。
从科学论文中提取问题和方法句子:使用公式化表达脱敏的上下文增强Transformer
本文提出了一种使用公式化表达脱敏的上下文增强Transformer,用于从科学论文中提取问题和方法句子,在两个数据集上分别实现了3.71%和2.67%的宏F1分数提升。
EURO-5K:领域预训练何时重要?面向欧盟报告义务抽取的Transformer基准测试
本文介绍了EURO-5K,一个用于从欧盟立法中提取报告义务的句子级数据集,并在全微调和参数高效QLoRA下对判别式和生成式Transformer模型进行了基准测试。结果表明,法律预训练主要惠及适应能力有限的模型,且所有方法在大约3000个样本时趋于收敛。
域适应总是有帮助吗?一项关于跨域情感迁移的冻结骨干网络研究
本文探讨了在使用冻结的预训练语言模型骨干时,显式域适应方法是否对情感迁移有益,发现其有效性取决于骨干是否已经拥有目标域知识。