ObserverBench:测试用于干预和控制的机制估计
摘要
ObserverBench是一个基准框架,旨在通过报告估计准确性和下游行动性能来评估AI模型中的内部估计器是否适合指导干预、控制或安全任务。
arXiv:2609.03026v1 公告类型:新
摘要:机制解释性正被越来越多地用于指导干预,如激活引导、电路移除和安全监控。然而,即使平均准确的内部估计仍可能选择糟糕的行动。
我们提出了ObserverBench,一个基准框架,用于测试内部估计器——观察者——是否适合其指导的干预、控制或安全任务。每个任务固定模型、信息边界、允许的行动、决策规则、保留案例和损失。基准单独报告估计准确性和所选行动导致的损失。
理论和实验表明为什么两者都需要。在闭环控制中,观察者错误在起点和允许干预可达到的方向上都很重要。在GPT-2-small和Qwen2.5-7B的电路干预任务中,配对观察者预测未见效果更准确,但并不总是选择更好的行动;在行动损失上训练的观察者选择损失更低的行动。在安全分类中,完美分离违规的分数在违规成本不同时可能分配固定干预预算不佳。在Qwen2.5-7B、Gemma-2-9B-it和预期冻结的Qwen3.5-9B APPS任务中,AUROC可能以不同于部署损失的方式对监控器排名,且最佳信息源随模型变化。稀疏SAE读出在报告的Qwen面板上也落后于其层匹配的密集控制,在已知激活密度或检查点不匹配的情况下。
ObserverBench提供固定任务契约、可运行基线和基于表格的提交,以通过其启用的行动来评估解释性方法。
查看缓存全文
缓存时间: 2026/09/04 06:20
# ObserverBench:测试用于干预与控制的机制估计 来源:https://arxiv.org/html/2609.03026 2026年9月1日 ###### 摘要 机制可解释性正被越来越多地用于指导干预,例如引导激活、移除回路或强制执行安全边界。然而,一个平均而言准确的内部估计,在用于选择具体行动时,仍可能导致糟糕的决策。我们提出了 **ObserverBench**,这是一个用于测试内部估计器——即“观察者”——是否足以胜任其指导的干预、控制或安全任务的基准框架。每个任务固定模型、观察者可用的信息、允许的行动、决策规则、未见测试用例和损失。ObserverBench 同时报告估计准确性和下游行动性能。其排名是任务特定的:观察者仅在相同的信息和行动约束下进行比较。我们的理论和实验展示了这些标准可能不同的三种方式: - • **任务相关准确性。** 在控制循环中,观察者的误差在起点以及允许干预可以达到的方向上都很重要。 - • **预测与决策。** 在针对 GPT-2-small 和 Qwen2.5-7B 的回路干预任务中,成对观察者在预测未见过的干预效应时更准确,但并不总是选择更好的行动。经过直接预测行动损失训练的观察者会选择损失更低的行动。在一个 Qwen APPS 面板上,一个127系数的 SAE 读出在平均审计损失上高于其层匹配的3584维密集控制,这在一个已披露的激活密度不匹配(观察到的 L₀=115 vs 报告的 240)下发生:这是在该面板上实现了压缩但并未做出更好的决策。 - • **后果感知的安全性。** 在固定干预预算下,一个能完美分离策略违规的分数,在违规成本不同时可能分配行动不当。在匹配的 Qwen2.5-7B、Gemma-2-9B-it 以及前瞻性冻结的 Qwen3.5-9B APPS 任务中,残差访问平均领先,但损失最低的上下文会变化——甚至在两个 Qwen 检查点之间也是如此,AUROC 也可能以不同于部署损失的方式对监视器进行排名。在 Qwen3.5 上,一个官方的 Qwen-Scope SAE 探针也落后于其密集源残差,因为存在已声明的基础训练到后训练的检查点不匹配。ObserverBench 提供了一种通过可解释性方法所实现的行动来评估它们的通用方式。 ## 1 引言 可解释性方法越来越多地被用于引导和治理模型行为,而不仅仅是解释它。内部估计现在指导具体的决策:应用哪个激活引导方向、移除哪些注意力头、是否允许有风险的工具调用,或哪些请求获得有限的人工审核预算。激活工程和反馈控制方法使这些估计成为主动控制循环的一部分[3, 4, 5, 6]。一旦内部估计被用于选择行动,仅仅统计准确性就不够了[29, 30, 15]:一个估计可能平均表现良好,但在单个提示上仍会导致代价高昂的错误。 为了分析这些系统,我们将决策循环分为三个部分。**观察者** 读取测量值并估计内部状态或干预效应。**控制器** 使用该估计来选择行动。**干预** 是其允许采取的编辑、消融或策略行动。ObserverBench 追问观察者是否足以胜任那个特定的决策。 三种失败模式说明了为什么必须分别报告预测准确性和决策质量。在安全分类中,观察者可能完美分类策略违规,但却将有限的审核预算花在低风险案例上,同时允许更高影响的危害发生。这是 **后果忽视**(第5节)。在模型编辑中,观察者可能准确预测回路消融的平均效应,但却选择一个在不同提示上效应差异很大的编辑。这是 **离散度失明**(第4.1节)。一个内部激活探针也可能重复提示或输出 logit 中已可见的信息。这样的 **冗余信号** 增加了模型访问权限,却没有改善下游决策(第5节)。 我们引入 ObserverBench111公开工作台和提交页面:https://kwisatzh.github.io/observerbench/,一组固定的、可重复使用的任务,使这些操作性区分变得可衡量。每个任务固定模型、观察者可用的信息、允许的干预、控制器、测量预算、留出测试用例和损失。在任务内,每个观察者面对相同的控制器和评估工具。评估器分别报告两个结果:观察者预测其目标的准确性,以及其选择的行动在留出用例上造成的损失。 ObserverBench 聚焦于可解释性的操作阶段。机制层析成像解决了测量问题:如何设计探针和干预以恢复隐藏的内部机制和效应图。ObserverBench 解决了决策问题:一个提出的估计是否足以指导特定的干预、控制循环或安全策略[1]。对于安全任务,ObserverBench 冻结审核策略并比较其内部的监视器。AI 控制评估则提出了一个互补的、更困难的问题:当自适应模型试图颠覆它时,整个协议是否仍然安全[20]。这里表现良好的监视器仍然必须通过那个端到端测试。 ObserverBench 评估明确了五项选择。它陈述 **目标**:一个内部状态、一个干预的平均效应,或者可能是一个行动在一个提示上的损失。它陈述 **信息和完整性边界**:观察者可以读取什么,以及谁可以修改、省略、延迟或伪造这些测量。它固定 **行动空间** 以及 **决策规则和损失**,这决定了估计如何转化为行动以及哪些错误是重要的。最后,它声明 **操作区域**,包括提示、干预预算、攻击频率、情节范围和攻击者假设。这些选择使得观察者的充分性是任务相对的:权限、工具接口、预算、攻击率、旁路通道和评估器持有的证据是评估的一部分,而不是背景细节。在2026年 OpenAI–Hugging Face 事件中,智能体使用了未经授权的渠道并伪造了一些工具调用,这激发了完整性边界的概念[31, 32, 33]。ObserverBench 在三种标准化的操作模式中实例化了这些选择——闭环控制、效应预测和安全分类——总结在第2节。 ##### 贡献。 - • **一个可扩展的评估工作台。** 版本化的任务和观察者卡片支持本地实现和基于表格的提交,使用一个共同的评估器(第2节)。 - • **一个正式的控制充分性测试。** 对于带有偏移的线性读出,观察者仅需在起点以及允许干预可以达到的方向上匹配目标。一个精确的有限视界恒等式随后分离了残差报告误差、起始状态不匹配以及沿编辑方向的目标-观察者响应不匹配(第3节,公式1)。 - • **预测和压缩并非决策。** 成对模型改善了在 GPT-2-small 和 Qwen2.5-7B 上的留出效应预测,但更好的平均预测并不总能可靠地改善所选的 GPT-2 行动。相对于相同特征的平均观察者,直接损失训练在干净的 GPT-2 确认中降低了 18.5% 的行动损失,在 Qwen 聚合中降低了 8.9% [16, 23, 24]。在 Qwen 安全任务中,一个稀疏 SAE 读出使用了远少于其层匹配的密集控制的系数,却导致了更多的逃逸攻击:*压缩但没有更好的决策*(第4.1.5、4.2和5节)[28]。 - • **分类对于安全性来说并不足够。** 在授权任务中,一个 AUROC 为 1.000 的标签观察者,当其忽视后果时,会将固定的干预预算分配得很差。在外部 Gemma APPS 任务上,AUROC 和实际违规情况颠倒了两个监视器的排名。在匹配的 Qwen2.5-7B、Gemma-2-9B-it 以及前瞻性冻结的 Qwen3.5-9B 任务中,残差观察者平均领先,而损失最低的上下文会变化——甚至在两个 Qwen 检查点之间也是如此(第5节)[20, 21, 25, 26]。 下一个问题是操作性的:ObserverBench 到底固定了什么,研究人员可以提交什么,以及评估器返回什么? ## 2 ObserverBench 如何评估观察者 公平的比较需要将决策问题固定。否则,更低的损失可能反映了一个更好的观察者、一个更有能力的控制器、更简单的行动,或不同的测试分布。因此,ObserverBench 将这些选择视为任务的一部分。 每个评估使用一个**任务卡**、一个**观察者卡**和一个**结果计分卡**,分四步进行: 1. 1. **选择任务。** 任务卡使用上述五项选择来定义决策问题,并固定训练测量、留出用例、预算和干净性能检查。当观察者进行比较时,这些不会改变。 2. 2. **提交观察者。** 只要尊重任务的信息和完整性边界,可以使用任何方法。观察者卡记录观察者读取的内容、这些测量的来源、如何拟合或校准、它需要哪些模型访问权限,以及任何已知的故障条件。对于控制任务,它还需声明提交是否替换了状态估计、编辑方向或两者。如果两者都改变,分数适用于这对组合。 3. 3. **运行共同评估器。** 每个观察者接收相同的留出用例,并面对相同的控制器、行动、预算和损失。 4. 4. **比较结果和成本。** 结果计分卡报告预测质量、下游行动损失,以及获取该估计的访问或测量成本。 有两种方式跨越观察者-评估器边界。本地实现可以拟合和运行需要模型推理或内部激活的方法。公开提交则可以提供任务已发布用例的预测或分数表。第二种路线让研究人员无需安装原始模型或实验堆栈即可测试观察者。 在这两种路线中,是任务——而非观察者——应用留出目标、控制器和损失。这三种操作模式共享此约定,但提出不同的问题(表1)。 表 1:ObserverBench 操作模式。每一行定义了一个完整的、任务相对的比较。ObserverBench 不会将不同模式或任务版本合并为一个总体排名。每个计分卡识别哪个观察者对于一个声明的用途更好。 该工作流使结果具有可比性。三条额外规则确保每次比较有意义: - • **区分构建与评估。** 在测量留出性能之前固定目标、划分和干预。首先检查未经编辑的模型是否在基础任务和所需组上成功;我们称之为**干净停止门**。 - • **使比较可观察。** 测量设计必须实际检验被比较的效应。例如,如果相关的组件组合几乎从未被测量,则无法评估其交互作用。重复控制应报告轨迹上的误差,而不仅仅是阈值穿越。 - • **评估用于选择行动的量。** 平均效应预测、提示级干预损失和后果加权安全风险是不同的目标。任务应对控制器实际使用的那个进行评分。 这个约定告诉我们如何比较观察者,但它留下一个先前的问题未解决:观察者必须保留什么才能使其估计足以用于控制?第3节通过将准确性限制到允许干预可以到达的状态来回答这个问题。 ## 3 闭环控制:观察者必须保留什么 一旦被控模型、初始状态、允许的干预规则、控制器和损失被固定,只有影响可到达状态的观察者误差才能改变受控轨迹。观察者将模型测量转化为可以指导干预的信息。估计与干预之间的区别很重要。观察者可能正确报告模型距离目标有多远,但却将控制器指向一个无用的方向;反之,一个有用的方向可能配有一个糟糕的估计。 对于模型状态 h,令观察者估计一个量 ẑ,令 d 表示提议的干预方向:E(h) = ẑ,D(h) = d。控制器使用估计来选择行动幅度 u = C(y⋆, ẑ)。在这个固定系统中,测试 E 保持 D 固定,测试 D 保持 E 固定,同时改变两者仅能识别组合系统。 观察者不需要在每一个可能的模型状态上都正确。它只需要在允许的干预可以到达的状态上正确。具体来说,假设一个激活有三个坐标,但控制器只能移动前两个。第三个坐标上的错误系数无法影响此控制器。第一个坐标上的错误系数则会。 为了精确阐述同一思想,考虑一个仿射(线性加偏移)目标与观察者:z(h) = b_T + β_Tᵀ h,ẑ(h) = b_E + β_Eᵀ h。 令 h₀ 为起始状态。令 B 的列跨越允许的编辑方向。从 h₀ 出发,控制器只能到达 H_R = h₀ + U,其中 U = span(B)。观察者仅需在此可达集上匹配目标。 对于一个固定方向 d,这意味着其沿 d 的误差必须为零。 ###### 命题 1(可达子空间充分性)。 定义 δ₀ = z(h₀) − ẑ(h₀),δ_β = β_T − β_E。则对于每一个 h ∈ H_R,z(h) = ẑ(h) 当且仅当 δ₀ = 0 且 P_U δ_β = 0,其中 P_U 是到 U 的正交投影器。 ###### 证明。 每一个可达状态具有形式 h = h₀ + Bv。读出差异为 δ₀ + δ_βᵀ Bv。对于每一个 v 恰好为零当且仅当 δ₀ = 0 且 δ_β 在 B 的列所张成的空间中为零,这等价于 P_U δ_β = 0。 ∎
相似文章
TOBench:面向真实世界工具使用智能体的任务导向全模态基准
TOBench是一个新的基准测试,用于评估AI智能体在真实世界、任务导向的工具使用中的表现,涉及多模态输入和闭环验证。实验表明,像Qwen 3.5 Plus这样的顶级模型仅达到41%的成功率,远低于94%的人类基准,凸显了显著的差距。
BehaviorBench:面向行为科学任务的基础模型基准测试
本文介绍了BehaviorBench,一个用于评估基础模型在行为科学任务(包括行为预测、战略决策、主体特征推断和行为知识应用)上表现的综合基准。它还介绍了Be.FM-1.5,一个经过微调的模型,实现了出色的分布对齐,突显了通用模型与行为适应模型之间的差距。
MiraBench:评估机器人世界模型中的动作条件可靠性
MiraBench是一个分层基准测试,用于评估机器人世界模型中的动作条件可靠性,在12种模型配置下评估物理一致性、动作跟随准确性和乐观偏差。
基准测试未衡量的:论自主智能体弃权能力的评估
本文认为,目前的自主智能体基准测试未能评估智能体是否应该继续执行任务,从而引入了'合规偏见'。作者提出了一个需要弃权的场景分类法,以及新的评估协议(Safety Rate, Usability Rate, Informed Refusal Rate),初步结果显示,不同模型家族的安全性与可用性之间存在可调节的权衡。
JobBench:让智能体工作与人类意愿对齐
JobBench 是一个基于工人调查构建的基准,用于评估 AI 智能体在工人最希望自动化的任务上的表现,涵盖 35 个职业的 130 个任务,并配备详细的评分细则。