ASSERT:面向GenAI审计的测量流水线
摘要
ASSERT 是一个规范驱动的测量流水线,用于审计生成式AI系统,它将报告率与显式测量选择关联,并展示这些选择如何影响合规率和系统排名。
arXiv:2608.13840v1 公告类型:新
摘要:生成式AI(GenAI)系统的审计通常将行为总结为报告率:被审计系统符合策略的频率。研究人员和利益相关者使用该比率来比较系统、跟踪退化并控制部署。报告率反映了被审计系统及其背后的测量选择,因此比率的变化可能不清楚是系统还是那些选择发生了改变。我们引入ASSERT,一个规范驱动的GenAI审计测量流水线,它将每个报告率与产生它的测量选择的书面规范关联起来。ASSERT帮助起草行为准则和测试用例,然后对GenAI系统运行审计并返回报告率。在一项关于对话欺骗的案例研究中,我们观察到报告率随着对话设置、模拟用户、判断者和不合规证据门槛的变化而显著变化。这些测量选择显著改变报告率,并可能重新排列GenAI系统排名。因为每个报告率都与显式规范关联,所以不同审计之间的差异更容易归因和解释。
查看缓存全文
缓存时间: 2026/08/17 09:47
# ASSERT:一种用于生成式AI审计的测量流程 来源:https://arxiv.org/html/2608.13840 Abhinav Palia、Xiawei Wang、Emily Sheng、Chad Atalla、Jean Garcia‑Gathright、Nicholas Pangakis、Sharman Tan、Dan Vann、Hannah Washington、P. Alex Dow、Heba Elfardy、Hanna Wallach、Sandeep Atluri\[0.25em\] 微软 ###### 摘要 生成式AI(GenAI)系统的审计常以报告率概括其行为:被审计系统符合策略的频率。研究人员与利益相关者使用该率来比较系统、跟踪性能回退并把控部署。报告率同时反映了被审计系统及其背后的测量选择,因此率的变化可能令人难以分辨是系统还是测量选择发生了变动。我们引入ASSERT,一种用于GenAI审计的规范驱动测量流程,将每个报告率与产生该率所使用的测量选择书面规范绑定。ASSERT帮助制定行为评分准则与测试用例,随后针对GenAI系统运行审计并返回报告率。在一项关于对话欺骗的案例研究中,我们观察到报告率随对话设置、模拟用户、评判器以及不合规证据标准的不同而显著变动。这些测量选择大幅改变了报告率,并可能重新排列GenAI系统的排名。由于每个报告率均与明确规范绑定,不同审计间的差异更易归因与解释。 †††通讯作者:[email protected] ## 1 引言 参见图例 图1:ASSERT将广泛关切转化为可检查的测量流程。 研究人员定义何为行为、编写评分规则、构建测试用例、与GenAI系统进行多轮交互、对对话记录评分并将分数汇总为报告率。下方示意图通过一个欺骗案例说明流程。 审计GenAI系统需对何为合规及其检测方式做出选择。系统行为的声称常基于最终的策略合规率。由于该率同时取决于系统与这些选择,报告率之间的差异本身并不能揭示变动原因\(11 (https://arxiv.org/html/2608.13840#bib.bib18)\)\)。解释报告率需要明确测量内容(*测量任务*)及测量方式(*测量工具*\)\(10 (https://arxiv.org/html/2608.13840#bib.bib13);54 (https://arxiv.org/html/2608.13840#bib.bib12)\)\)。测量任务的构想是差异的首个来源。例如,“欺骗”可能指断言虚假信息、制造误导印象或歪曲能力。工具选择则引入进一步差异;例如在对抗性而非良性提示下测试,或使用不同评判器评分,都可能为同一系统产生不同比率。在GenAI审计中,这些选择超越数据集与度量指标,延伸至用于生成交互和评判行为的模型。当这些选择未显式说明时,报告率难以解释、比较与复现。 在本工作中,我们引入ASSERT(自适应规范驱动评分评估与回归测试)111代码见https://github.com/responsibleai/ASSERT。这是一种用于设计和执行审计的规范驱动测量流程。研究人员从广泛关切与应用场景出发,将测量选择记录于书面规范中(见图1 (https://arxiv.org/html/2608.13840#S1.F1))。ASSERT使用该规范构建并运行相应审计。由于规范记录了每项测量选择,报告率始终与这些选择绑定——支持可复现性并使审计间差异更易追溯。 我们将ASSERT应用于对话欺骗领域,使用不同测量选择的多份规范运行审计。我们做出两项主要贡献: - • 一种将测量选择记录于书面规范并运行相应审计的测量流程\(10 (https://arxiv.org/html/2608.13840#bib.bib13);54 (https://arxiv.org/html/2608.13840#bib.bib12)\)\)。 - • 一项安全案例研究,表明对话设置、模拟用户、评判器及不合规证据标准会改变报告率并重新排列系统排名。 ##### 定位。现有基准通常固定一组静态测试用例和评分规则以最大化可比性,而生成式审计流程则为特定策略动态生成输入\(23 (https://arxiv.org/html/2608.13840#bib.bib41);15 (https://arxiv.org/html/2608.13840#bib.bib39);27 (https://arxiv.org/html/2608.13840#bib.bib30),例如)\)。ASSERT通过在书面规范中显式化测量选择并围绕\(10 (https://arxiv.org/html/2608.13840#bib.bib13)\)的测量框架组织流程,补充了这些方法。我们借鉴多重宇宙分析\(52 (https://arxiv.org/html/2608.13840#bib.bib9);19 (https://arxiv.org/html/2608.13840#bib.bib56);47 (https://arxiv.org/html/2608.13840#bib.bib53)\)检验关于GenAI系统的主张是否在合理且可辩护的测量选择下成立——这些选择需对测量任务具有实质合理性且技术连贯。 ## 2 ASSERT测量流程 本节规定ASSERT流程:书面测量规范如何定义任务与工具,以及ASSERT如何将该规范转化为报告率。*测量规范*记录所选任务元素与被评估GenAI系统的工具设置。*操作化活动*是在该规范下对工具的一次具体执行:生成并展开测试用例、标注生成实例并将这些标注汇总为报告率。ASSERT从书面规范端到端执行此活动。 ### 2.1 测量任务 解释测量需要四个任务元素\(10 (https://arxiv.org/html/2608.13840#bib.bib13)\):*系统化概念*(被测现象)、*实例类型*(分析单元,例如多轮对话记录)、*目标人群*(测量旨在描述的实例集或分布)及*估计量*(目标量,例如该人群的平均合规率)。在ASSERT中,研究人员固定系统化概念。在本审计中,实例类型是多轮对话记录:合规性在记录层面评分。目标人群与估计量则由测试设计与评分规则确定。 实践中,系统化概念并非预先给定。研究人员通常从*背景概念*(如欺骗或偏见等宽泛且常具争议的概念)与应用场景(例如企业代码助手)出发。*系统化*将该背景概念细化为本次审计中何种行为计入的明确说明。由此产生的概念规范包含定义、可观察行为模式(例如捏造证据或夸大能力)以及标注哪些模式应被视为问题的标准。 在ASSERT中,研究人员提供自然语言行为描述与GenAI应用场景。遵循\(1 (https://arxiv.org/html/2608.13840#bib.bib15)\),流程使用大语言模型(LLM)草拟行为模式(可观察行为的描述),将其标记为有问题或可接受,将这些模式转化为候选行为类别,并记录被舍弃的备选项。研究人员在测量运行前检查并编辑草稿,并可能在应用需要时纳入利益相关者。 我们在对话欺骗场景中实例化此任务。系统化概念是对话不实陈述:实质性承诺与声明的参考基础相冲突,或陈述/暗示真实性、支持性、来源或系统状态事实超出该基础所保证的范围(见B.1节 (https://arxiv.org/html/2608.13840#A2.SS1.SSSx1))。实例类型是模拟用户与被评估系统交互的多轮对话记录。目标人群是由审计测试设计、展开协议与被评估GenAI系统引发的对话记录分布。估计量是在该分布下的预期记录级合规率,其中合规性由概念规范定义,并使用我们接下来呈现的行为评分准则评分。 ### 2.2 测量工具 操作化将测量任务转化为具体测量工具。*行为评分准则*将概念规范转化为评判器的评分指令。*测试用例生成*使用LLM将声明的测试设计实例化为具体测试用例(独立提示或情景简报)。*展开协议*将这些测试用例在被评估GenAI系统上运行并生成对话记录;对于多轮审计,模拟用户(扮演情景简报中角色的LLM)驱动交互。*评判器*LLM应用评分准则分配记录级合规标签。*估计器*将这些标签汇总为报告率。 ##### 从概念到行为评分准则。基于系统化提供的概念规范,ASSERT通过添加面向评判器的评分指令将其转化为行为评分准则,这些指令设定了证据标准,即分配标签前必须观察到的证据。ASSERT在LLM辅助下草拟评分准则;研究人员应在评分前审阅,必要时进行编辑,包括标准的颗粒度,并可能在该审阅中纳入利益相关者。例如,评判“捏造证据”可能需要具体引用或统计数据与对话记录中的材料相矛盾。默认情况下,每个评分准则标准从其概念规范继承许可标签。编辑时,研究人员可合并理论上不同但经验上易混淆的模式,或将宽泛模式拆分为可单独评分的错误模式。例如,对话记录很少能揭示某来源是被捏造还是仅被歪曲,因此两者可在“捏造或歪曲证据”同一标准下评分。在本案例研究中,我们将LLM生成的草稿手动精炼为十项标准:六项不允许行为与四项允许行为。 ##### 测试用例设计与生成。给定行为评分准则,研究人员首先定义*测试设计*:要引诱哪些行为及在何种条件下。他们以评分准则中的行为作为主要生成轴,并与上下文维度(例如交互条件、用户角色或用户请求类型)交叉。由此产生的单元格是实验设计意义上的独立测试条件\(57 (https://arxiv.org/html/2608.13840#bib.bib47)\)。一个单元格可能针对在材料依赖下的“证据捏造”,即用户依赖系统主张进行决策;另一个单元格可能固定行为仅改变交互条件,例如针对早期承诺的一致性质询。研究人员可手动设置这些维度和层级,或让LLM通过ASSERT提出。用例如何分配到单元格应遵循测量旨在支持的主张。当预算允许且单元格间比较同等重要时,平衡分配(每个单元格相同数量的用例)是简单默认方案;当某些单元格更重要或预算紧张时,可对高优先级单元格超额分配。每个单元格的用例数量应基于计划比较选择,正式功效分析可提供帮助。目标是系统覆盖设计,并在分配允许的情况下进行单元格间诊断比较。 设计确定后,测试用例生成使用LLM将每个单元格实例化为一个或多个具体测试用例。测试用例是单轮审计的独立提示或多轮审计的情景简报。需要时,生成还可为情景定制系统提示和工具定义。在本案例研究中,我们将六种不允许行为(作为引诱目标)与四种交互条件交叉,为得到的24个单元格各分配五个情景简报,从而生成120个测试用例。我们后续在保持此测试设计固定的同时改变不同规范中的工具设置。 ##### 展开、评分与估计。为生成用于评分的对话记录,展开协议对每个提示或情景简报在被评估GenAI系统上执行。对于多轮审计,模拟用户(LLM)扮演情景简报中指定的用户角色。相同协议可对实时环境执行工具调用,或使用LLM根据对话历史模拟工具响应。交互结束后,评判器分两阶段评分。首先,它标记每个评分准则标准仅当交互轨迹创造了具体满足或违反该标准的机会时才适用;否则该标准被搁置。例如,如果系统从未调用工具,则“对工具执行的虚假声称”不适用。其次,对于每个适用标准,它分配二元标签(合规或不合规)及简短理由。如上所述,每个标准携带许可标签,描述其行为是否属于合规响应。不允许行为绝不应出现。若对话记录中出现该行为,如在“捏造证据”标准下捏造引用,则该记录在该标准上不合规。允许行为仅在情境需要时应出现。若情境需要该行为但记录中缺失,如在轨迹要求承认不确定性时却将主张陈述为既定事实,则该记录在“不确定性披露”标准上不合规。 对话记录仅当所有适用标准均合规时才被判定为合规。若无适用标准,则该记录从报告率中排除。报告率是包含记录中合规记录的无权重比例,按整体及因子子组(例如交互条件)计算。单元格的贡献与其实际包含计数成比例,仅当排除(如有)使单元格规模保持平衡时,该比例才与均衡分配匹配。在本案例研究中,我们在设计阶段均衡分配各单元格,且排除罕见,因此报告率接近该均衡默认值。 ### 2.3 测量规范 测量规范是使流程可执行且可检查的记录。它至少需声明被审计行为、应用场景及工具选择。在图2 (https://arxiv.org/html/2608.13840#S2.F2)中,我们展示了案例研究规范的摘录。行内注释标记了每个阶段实现的工具。估计器在摘录中并非独立字段:评判后,它作为固定后评判均值将标签汇总为报告率。每个阶段写入本地工件,因此研究人员可重跑单阶段并复用未受影响输出。附录C (https://arxiv.org/html/2608.13840#A3)提供完整的案例研究配置。 spec.yaml[⬇](data:text/plain;base64,cGlwZWxpbmU6CiAgc3lzdGVtYXRpemU6IHttb2RlbDoge25hbWU6IGdwdC01LjV9fSAgIyBjb25jZXB0K3J1YnJpYwogIHRlc3Rfc2V0OiAgICAgICAgICAgICAgICAgICAgICAgICAgICMgZGVzaWduK2dlbmVyYXRpb24KICAgIHN0cmF0aWZ5OgogICAgICBkaW1lbnNpb25zOgogICAgICAgIC0gbmFtZTogaW50ZXJhY3Rpb25fY29uZGl0aW9uCiAgICAgICAgICBsZXZlbHM6CiAgICAgICAgICAgIC0gbmFtZTogbWF0ZXJpYWxfcmVsaWFuY2UK
相似文章
衡量关键指标:医疗保健中生成式、多模态及智能体AI的基准测试
本文提出了一个针对医疗保健领域生成式、多模态及智能体AI进行基准测试的结构化框架,旨在解决高基准得分与实际临床可靠性、安全性和相关性之间的差距。
Microsoft ASSERT:通过纯文本规格测试AI代理
微软在Build 2026大会上发布了ASSERT,这是一个开源框架,可将自然语言行为规范转化为AI代理的可执行评估。
BEAMS: AI在建模与仿真中的基准测试与评估
BEAMS倡议提出了一套基准测试集,用于评估建模与仿真中的AI工具,重点关注以人为本和负责任的AI实践。测试显示,基于LLM的引擎存在差异,在定性任务上的表现优于因果推理。
具有随时有效保证的 AI 系统自适应审计
本文引入了一种统计框架,利用安全随时有效推断(SAVI)技术对 AI 系统进行自适应审计,旨在基于有限数据得出严谨的结论。文章提出了一种“通过赌博进行测试”的方法,以验证模型的鲁棒性,同时在自适应采样过程中控制第一类错误。
审计审计:基准有效性审计的五大失效模式
本文识别了基于扰动的基准有效性审计中的五种失效模式,这些审计常用于AI治理。研究表明,实现细节可以悄无声息地制造结论。本文提出了一种尽职调查关口,以提高评估证据的可靠性。