相似性门控批准反向操作:智能体系统中嵌入余弦阈值的有效性审计

arXiv cs.CL 论文

摘要

本文对智能体系统中用作质量门的嵌入余弦相似度阈值进行了审计,表明它们衡量的是措辞重叠而非语义。反向操作通过了门控,而无害的改写却常常失败,生产环境中的漂移防护捕获了零个破坏语义的突变,且在所有测试配置下平衡准确率从未超过0.700。

arXiv:2608.10216v1 公告类型:新 摘要:智能体框架内置质量门,通过嵌入余弦相似度比较文本块,并在固定阈值处作出判定。去重过滤器、语义缓存、漂移防护和答案评分器都部署了此类门控,以回答这样一个问题:“这段文本的含义是否仍然相同?”但该分数回答的是另一个问题:“措辞改变了多少?”我们将此类门控作为测量工具进行审计。在这些门控旨在捕获的情形中,二者可能朝相反方向运行。很多时候,反转一条指令只是一个单词的编辑,而语义一致的改写往往涉及整句重述。其后果是安全检查反向触发。我们审计的生产漂移防护在56个破坏语义的突变中捕获了0个,而一个被批准的项目“ withhold the study drug”(停用研究药物) -> “administer the study drug”(给予研究药物)的余弦相似度高达0.9608。我们观察了五个已部署的工作点,90个配置-阈值-任务组合的平衡准确率从未超过0.700(中位数0.525)。同一混杂因素也破坏了评估结果。朴素构建的语料库继承了这一混杂因素,可能得出相反的结论:在18个配置-任务组合中,有13个的决策AUROC恰好为0.000(全部18个中最高为0.040),而在平衡的2x2设计下,相同九个配置的AUROC为0.440-0.815。在此项工作中,有两次我们的头条结论也被这一因素所误导。明显的修复策略均告失败:更换编码器和基于重叠条件的门控(样本内0.750,留出0.533)在独立撰写的留出数据上仅达到随机水平,而NLI替代方案也不更优。嵌入在此仍存希望:九个配置中最强的两个在匹配重叠条件下能够区分反转与改写(AUROC 0.79-0.90),但只有配对审计才能揭示部署状态。我们公开了语料库方法、测试框架和固定结果,并主张以这种方式门控的分数衡量了错误的对象。我们相信一个有效的测量工具是可以构建的。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:33

# 相似性门控放行反转:智能体系统中嵌入-余弦阈值的效度审计

Source: https://arxiv.org/html/2608.10216
\(2026年8月4日\)

###### 摘要

智能体框架附带质量门控,通过嵌入-余弦相似度比较文本块,并在固定阈值处做出决定。去重过滤器、语义缓存、漂移防护和答案评分门控的部署,都是为了回答这样一个问题:“这段文本是否仍然表达同一件事?”但这个分数回答的是另一个不同的问题:“措辞改变了多少?”我们将这类门控作为测量工具进行审计。在这些门控原本要捕捉的情形中,这两者可能朝着相反方向运行。很多时候,反转一条指令只是单个词的编辑,而同意往往是对一句话的改写。其后果就是安全检查出现“反向触发”。我们审计的生产漂移防护捕获了56个破坏语义的变异中的0个,而一个被批准通过的条目,“ withhold the study drug”→“administer the study drug”,余弦相似度为0.9608。我们观察了五个已上线的操作点,在90个配置-阈值-任务单元中,平衡准确率从未超过0.700(中位数0.525)。同样的混杂因素也污染了评估。一个以自然方式构建的语料库继承了这种混杂,并可能返回颠倒的结论,在18个配置-任务单元中的13个里,决策AUROC恰好为0.000(全部18个最多为0.040),而同样的九个配置在平衡的\(2\times 2\)设计下,AUROC为0.440–0.815。在本次工作中,有两次它甚至捕获了我们自己的标题性结论。简单的修复并不奏效:更换编码器,以及一个基于重叠条件的门控(样本内0.750,留存集0.533),在单独撰写的留存数据上只达到随机水平,而NLI替代方案也未见更好。嵌入在这里仍然有希望,因为九个配置中最强的两个在匹配重叠条件下能够区分反转和改写(AUROC 0.79–0.90),但只有配对审计才能揭示部署工况。我们发布了语料库方法、测试框架和冻结结果,并主张如此门控的分数测量的是错误的东西。我们相信一个有效的测量工具是可以构建的。

## 1 引言

一系列已上线的安全和质量检查假设嵌入-余弦相似度可以度量语义上的一致性,而更准确地说,这些检查度量的是措辞上的相似性。在这些检查原本要捕捉的句子对中,措辞与语义是反相关的:否定一条指令只插入一两个词,其余保持不变,而用全新措辞表达同意则几乎替换了所有词。对这一分数设置阈值的门控会把一个句子与其自身的否定句配对,并将两者视为同一条指令。此外,可观察到的失败集中在一侧,即“配对”侧:反转被当作同一条指令而通过(§6;Figure 1 (https://arxiv.org/html/2608.10216#S1.F1))。我们审计的四个组件测试套件中没有包含任何能揭示这一问题的案例。

clinicianwithholdparticipantclinicianadministerparticipantsilhouette overlap: what cosine readsthe valves: where meaning livescosine 0.9608 guard fires below cosine 0.60 it did not fireFigure 1:反转的图示。一个翻转的阀门区分了“withhold”和“administer”;这两个轮廓几乎重合,而门控读到的正是轮廓。这个留存对在生产配置下得分余弦0.9608,触发线为余弦0.60(§6)。门控没有触发。2021年,Jacobs和Wallach在理论构念与其操作化之间的不匹配中定位了一类广泛的系统危害。Li等人(2026)随后给这一具体错误命名:“代理预设”(Proxy Presumption),即将嵌入的几何属性直接当作构念的测量,而表示其实是该构念与主题、风格、作者身份等混杂因素的纠缠混合物。他们的混杂因素在我们的设定中就是词汇重叠;他们的判别效度检验在结构上正等同于我们的因子设计。这些组成事实也已有文献记录。掩码语言模型在很大程度上忽略否定(Kassner & Schütze, 2020; Ettinger, 2020),而句子嵌入相似度将否定对排在*最高*的位置。Blagec等人(2019)发现,在他们测试的每个模型上,否定和反义词子集的得分都高于真正相似的句子对,平均余弦在0.93–0.999之间;Anschütz等人(2023)发现从这类模型中学到的评估指标对否定不敏感。评估层对这一切的盲目性本身也有文献记录,见于NLI基准(Hossain等人,2020)和句子编码器评估(Chiang等人,2023)。

这些文献都没有审计部署对象本身,即“控制面”:在这里,无效测量工具产生的不是错误的估计,而是反向触发的安全检查。相邻的智能体系统研究提示,基于嵌入的行为测量对语义变化的敏感度*低于*人类判断(Rath, 2026)。Zizzo等人(2025)针对不同的威胁模型来基准化护栏,即对抗性提示而非不忠实的改写。Wang等人(2026)综述了智能体的过程级问责(来源、运行时护栏、可观测性),而语义相似度测量工具的效度问题不在该综述的范围内。

我们贡献了这次审计及其产物:

1. 1. 语料库设计结果。自然撰写的评估语料库中,词汇-决策混杂是结构性的(否定是增量式编辑,改写是替换式编辑),因此作者意图无法消除它,而匹配式生成可以。一个复现自然模式的语料库使我们测试的每个编码器都显得被颠倒,在18个配置-任务单元中的13个中决策AUROC恰好为0.000,全部18个最多为0.040(§3)。在本研究过程中,同样的混杂因素还捕获了我们自己的两个主张(§8)。
2. 2. 一个审计工具及其显示的结果。一个\(2\times 2\)因子语料库(决策×词汇重叠,每个锚点平衡、编码器盲构建)将余弦所测量的东西与那些被仪表化的门控所部署测量的东西区分开来。此外,构造出的词汇对比被作为阳性对照恢复,其强度取决于构造时两极间的分离度。我们发现,所有九个配置的分层AUROC为0.975–1.000,而相同句对上的决策内容跨度为0.440–0.815:编码器之间表现出异质性,而被审计系统中部署的配置则处于随机水平(§5)。
3. 3. 部署系统结果。被审计的生产漂移防护在两个语料库中捕获了56个破坏语义的变异中的0个,其中一个语料库是在有记录的隔离条件下撰写的。其最差的变异类别正是操作上危险的类别:削弱义务,或改变数量。值得注意的是,不是否定(§6)。
4. 4. 对明显修复方案的预注册阴性结果。更换编码器以及基于重叠条件的门控在留存数据上都只达到随机水平,而NLI替代方案也没有更好(§7)。
5. 5. 一个已发布、离线、固定版本的测试框架和语料库方法,包括对已上线操作点的小规模流行率调查,以及一项审计,揭示了一种事后双曲投影模式在归一化嵌入上被证明是空操作(§9)。

语料库很小(每个单元10对),目前是单一标注者,且是在一个项目语域内生成的;§10陈述了这些限制,并不淡化它们。这些主张在我们的语料库和一个部署系统上得到了演示,并在其之外是被暗示(而非确立)的。

## 2 被审计的门控类别

模式:嵌入两段文本,计算余弦相似度,与一个常数比较。我们直接审计或在其安装默认值下审计的实例包括:

供应商和实践者会发布该模式的显式操作点(例如,建议将余弦距离截断值0.15作为有意义的漂移指示,以及以固定偏差触发的滚动基线)。确切来源记录在发布的小规模流行率调查中。一项关键词搜索返回了36个候选门控位点,在我们打开并阅读的11个中,有9个是真实的余弦阈值门控,观测阈值范围为0.30–0.95,其中有一个在0.95处自动合并实体。我们只报告已打开并阅读的计数,因为流行率需要抽样框架和双编码者协议,而我们尚未运行。

## 3 混杂因素,以及朴素评估会返回什么

机制。否定及其亲戚(量域反转、情态削弱、数量变化)是增量式或最小编辑,因为它们插入或替换一个词元,其余保持不变。忠实复述一个决策则是替换式,会*替换*词元。这种不对称首先是语言学的,然后才是统计学的(否定是肯定-否定对中有标记的一员,通过对肯定基础进行操作来表达,而不是通过构造一个全新的句子;Horn, 1989),所以它是人们写作方式的一个属性,而不是某个语料库构建者的个人习惯。在我们的语料库中,自然反转与其锚点的词元-Jaccard≈0.72,而忠实全量改写约为≈0.06。因此,以自然方式创作的语料库会把词汇重叠与类别标签耦合在一起。在我们的语料库中,这种耦合强到足以颠倒结论(这实际上帮助推动了这一发现),尽管其强度因语料库和创作语境而异(§7)。我们第一个手工编写的语料库正是在这一点上未通过其自身的操作检查(层内重叠0.721 vs 0.520,置换p=0.014)。我们改用了按锚点、编码器盲匹配重叠的方式生成发布版语料库,并通过了检查(各层平衡p=0.108–0.980)。PAWS(Zhang等人,2019)确立了这个问题在资源端的一半(模型在高重叠非改写上失败,直到经过训练),但对抗性改写集只提供门控审计所需要的设计中的一个单元;似乎因子设计需要全部四个,包括任何此类集合都不包含的低重叠*同意*。

朴素设计会返回什么。在我们的平衡语料库内部模拟自然创作模式(词汇接近的对立 vs 词汇遥远的同意,每个任务10 vs 10),得到的决策AUROC在18个配置-任务单元中的13个中恰好为0.000,全部18个≤0.040。在无限制置换零假设下,完全分离各自携带p=1.08×10−5。锚点匹配设计违反了该零假设的可交换性,诚实的配对设计下限约为p≈0.002(1.95×10−3),仍然决定性。在平衡设计下,相同的编码器配置的分层决策AUROC跨度为0.440–0.815,在每个任务的40个句对上测量,而朴素比较只看到20个。领域中的较强一半达到0.73–0.815,而生产配置仍处于随机水平。这种颠倒既是语料库设计的属性,又通过编码器的词汇主导性得以实现。移除任何一个,它就会消失。

这不是玩具问题。该模式在我们两个先前存在的语料库上都复现了:一个假设区分集(余弦AUROC 0.000,n=8 vs 8,精确p=1.6×10−4)以及漂移防护的留存变异语料库(0.267,n=30 vs 10,95% CI [0.110, 0.438],在*错误*方向上排除随机)。它们的兄弟分割(0.25,n=4 vs 4;0.285样本内)指向同一方向,CI触及随机。我们引用全部四个,以便选择可见。这种测量伪影可能是“嵌入根本无法表示否定”这一民间传说的一个可能起源:按朴素方式测量时,它们看起来比盲猜更差。它们看起来是被颠倒的。已发表记录与这种解读一致。先前工作中测量的语料库级颠倒——否定和反义词子集的得分在接近上限的平均余弦下高于高度相似的句子对(Blagec等人,2019)——是在自然组装的子集上观察到的,而这正是混杂机制所预测的位置。

生态结构 vs 表示。在自然创作的输入中,最小编辑反转与其锚点共享高词汇重叠(平均Jaccard≈0.715);忠实全量改写共享低重叠(≈0.062)。在不匹配比较(9个配置×20个锚点)中,反转在180/180个案例中显得比改写移动嵌入更少(2.6–10.3×)。§8的对抗性审查确立了这一比率是反匹配的属性,而不是表示本身固有的盲目性。当词汇重叠保持恒定时,方向被抵消或逆转。此外,在冻结的因子结果中,36个配置-任务-层比较中的29个中,反转比改写*更*多地移动了嵌入。我们报告不匹配比较,因为部署输入正是这样形成。

## 4 测量工具

每个任务一个\(2\times 2\)因子语料库:决策(相同/相反;忠实/违背)×词汇重叠(接近/遥远),所有四个单元共享每个锚点(Figure 2 (https://arxiv.org/html/2608.10216#S4.F2))。总共有每个任务10个锚点,每个单元10对,两个任务(假设区分;约束存活),总共80对。重叠在按锚点的决策类别内平衡,通过构造实现,且不加载编码器。来自七个检查点的九个编码器配置(nomic的前缀和维度对;e5的两个前缀变体),包括被审计系统的精确生产路径(nomic-embed-text-v1.5,MRL-256,通过已发布的嵌入路由器路由)。所有运行均离线进行,针对固定的本地模型;结果是冻结的JSON。语料库、测试框架和逐对溯源以构件形式发布。

lexical overlapCLOSE(Jaccard≈0.72)DISTANT(≈0.06)decisionSAMEOPPOSITEnaive: AUROC 0.000(18个单元中的13个)stratified: 0.440--0.815(production 0.535/0.440)Figure 2:测量工具。每个单元将同一个锚点(灰色)与一个变体(墨色)配对;列固定词汇重叠,行固定决策。朴素比较(虚线)对比接近的对立与遥远的同意,读到的正是混杂因素:在18个配置-任务单元中的13个中,决策AUROC恰好为0.000。分层比较(实线)固定重叠,读出决策:九个配置的AUROC为0.440–0.815,生产配置为0.535/0.440(§3, §5)。我们对每个配置和任务使用两个测量:决策轴(同一决策与相反决策,在词汇层内,分层AUROC)和词汇轴(接近与遥远重叠,在决策类别内)作为阳性对照。该设计是判别效度检验,正如Campbell和Fiske(1959)以来该术语所承载的意义:测量必须追踪门控实际部署所要构建的那个构念,并且不能追踪它被怀疑实际在测量的*混杂因素*,两个对照都在同一组匹配句对上被仪表化。

## 5 有效测量工具显示的结果

阳性对照。所有九个配置在两个任务上都以分层AUROC 0.975–1.000恢复了构造出的词汇对比。测量工具和编码器都工作正常,因此后续结果并非噪声。该数值取决于我们将重叠两极放置得相距多远(按任务Jaccard分离≈0.64/0.68)。缩小到层内中位数分割(分离≈0.08–0.16)后,得到0.62–0.93(中位数≈0.72/0.74),而且在层内,余弦连续地追随着Jaccard(中位数Spearman 0.35/0.43)。余弦是一个分级的表面形式仪表,而不是它的阈值检测器。

决策轴是异质的,且已部署配置处于随机水平。分层决策AUROC跨度为0.490–0.808(区分任务,中位数

相似文章

At-Grok尚未收敛:Grokking表示指标的测量效度审计

arXiv cs.LG

本文审计了grokking中表示指标的测量效度,表明grokking过渡期的值高估了收敛后的电路复杂度,且压缩滞后于泛化。它提供了将onset与压缩分开的工具,并报告了关于一般性的负面结果。

审计自改进智能体中的框架篡改

arXiv cs.CL

该论文提出了一种针对自改进AI智能体中框架篡改的双轴分类法,构建了一个标注语料库以基准测试审计方法,并发现篡改在真实智能体轨迹中发生,强调了完整性风险。