标签
本文研究了微调语言模型中评估行为与部署行为之间的不匹配。它引入了一种方法,通过定位并干预内部表示来缩小这一差距。
本文将从认知科学中提出的QQ等式发展为针对大型语言模型(LLM)的审计标准,刻画了理论上的机制类别,并在一个开源权重的指令微调模型上进行了实证测试,结果发现饱和(近确定性响应)阻碍了分布级审计。
提出干预式基础审计作为一种黑盒、步骤级测试,用于检查LLM思维链推理是否真正依赖于其陈述的前提。在ProntoQA上使用GPT-4o进行评估,在检测证明树依赖关系上达到F1=0.806,显著优于自一致性基线。
ConceptSMILE是一个基于扰动的审计框架,用于评估基于概念的可解释人工智能的可靠性,已在视网膜眼底图像上进行了测试。
介绍“过度思考”技术,通过放大推理蒸馏模型中的推理权重,诱导语言模型泄露隐藏信息,在2B-32B参数规模的模型上展示了高达10倍的秘密泄露效果。
本文审计了自洽性与跨模型一致性是否是LLM正确性的可靠指标,发现一致性是一个弱的、依赖于场景的代理指标,且前沿模型表现出过度自信。
本文提出了一个对抗性社会认识论框架,用于分析涉及人类和大型语言模型的交流景观中的信任、欺骗和推理链,并概述了审计信任违规的机制。
本文介绍了推理一致性扫描,一种用于审计AI安全评估中思维链推理是否与最终答案逻辑一致的方法,并将其与忠实性区分开来。作者对不一致性子类型进行了形式化,构建了一个基准测试,实现了一个扫描器,并报告了跨模型和任务的研究结果。
OpenAI 描述了对 SWE-Bench Pro 的审计过程,使用了基于模型的调查代理和来自经验丰富的软件工程师的独立评审,以确保在大规模下的全面评估。
提出一种实用的审计器,利用成员推理攻击来计算遗忘参数ε的数据依赖下界,发现经过认证的算法(如模型裁剪、回退删除)与经验方法(如基于Hessian的遗忘、梯度上升)之间有明显差异:前者达到严密的下界,后者表现出较大的下界,表明遗忘效果不佳。
本文研究了在无法获取逐状态专家动作标签的情况下,对修复决策策略的自主AI系统的评估问题,采用了一个具有区域级诊断反馈的酒店定价模拟器。研究发现聚合对齐可能产生误导,并提议通过闭环结果而非行为距离来评估策略修复。
本文提出了一种因果审计框架,通过在推理过程中改变数据库状态来评估有限记忆语言模型中的遗忘情况,发现参数泄漏可忽略不计,删除后的正确性主要源于检索伪影而非残留的参数记忆。
SentryCode 是一款开源的、面向AI编码代理的内核级行为审计工具,能够记录文件/网络/线索活动,利用蜜罐令牌实现零误报的数据泄露检测,检测隐写隐蔽信道,并执行策略,全部在本地运行,无需网络调用。
本文使用演化博弈论对社区中一个最小化危害的AI代理与一个寻求认可的(RLHF)代理之间的竞争进行建模,分析采纳条件和福利结果。结果表明,尽管自我审计的代理可以占据主导,但这并不足以防止社区危害,且对齐和时间框架至关重要。
Miles Brundage呼吁联邦AI法规应包含透明度和审计要求,并指出支持监管有助于一位候选人在初选中获胜。
谷歌发布了一份更新后的AI政策框架,在审计及其他方面提出了更强、更详细的立场,标志着其公开立场的显著转变。
本文对RAG系统在三种评估构念下的八种自动归因指标进行了审计,发现同一构念内没有单一指标能在数据集间迁移,挑战了将它们视为可互换的常见做法。
一位从业者分享了在生产环境中监控自主AI代理的挑战和工具,涵盖了运行时提示注入检测、带推理轨迹的工具调用审计、行为漂移检测以及多代理授权,同时测试了Arize Phoenix、Protect AI Guardian、Metoro、Alice、Asqav和Microsoft Agent Governance Toolkit等工具。
ReasoningLens 是一个开源框架,为大型推理模型中的复杂推理链提供层次化可视化与诊断审计,支持结构化分析和错误检测。