要么复现,否则无效:为何训练端去污无法验证,以及评估端规则是什么样的 [D]

Reddit r/MachineLearning 论文

摘要

文章认为,由于固有的信任和检查问题,AI模型的训练端去污无法验证,并提出了一个评估端规则,通过控制评估过程来确保可复现性。

自从OpenAI在二月退役了SWE-bench Verified以来(每个测试的前沿模型都能为某些任务复现参考修复;定义不足的测试奖励了知道预期修复的做法),我一直试图精确写下去污报告能够和不能确定的内容。其主张:训练端去污有一个硬性下限。报告是依赖得分的一方在无人能检查的语料库上做出的声明,使用的是遗漏了释义和合成衍生品的匹配方法。语料库承诺和PSI使实验室的声明更精确,但其他人无法检查,因为两者都不能证明模型只在声明的语料库上训练,且目前的训练证明方案已被证明可被欺骗。替代方案是让评估端通过设计排除先前的接触:提交物从不接收标签,评估时无网络,评估者从指定提交构建并自行复现分数,在问题允许的情况下使用前向日期测试数据。我已经为小型表格模型实现了这一点,该帖子将已构建的部分与设计部分分开说明。它还列出了复现无法证明的四件事:基准有效性、通过重复提交抵抗自适应过拟合(尚无每个求解器的预算;这是开放缺口)、资助方侧泄露,以及无需数据的第三方可重运行性。今天的记录是一份审计收据,而不是可移植的证明;帖子明确说明了结果的完整ZK证明必须绑定什么(模型、输入、评分,全部绑定到一次评估),以及为什么仅证明推理是不够的。https://holdoutlabs-ai.github.io/reproduce-it-or-it-doesnt-count/ 对论证在哪里失效感兴趣,特别是来自任何运行过持久私人排行榜的人。
查看原文

相似文章

核查问题:AI在受监管企业上线前必须满足什么条件

arXiv cs.CL

本文分析了企业AI在受监管企业中的部署为何停滞不前,提出了一个包含准确性、可复现性、有据可依性和可检测性的生产标准。文章测量了不同模型和工具配置下的人工审查负担,表明置信度信号和来源引用可将审查率从100%降至49%,但自我验证增加了延迟,却没有提高错误容忍度。

AI红队评估能证明什么与不能证明什么

Hugging Face Daily Papers

本文形式化了AI红队评估的证据极限,推导出在固定测试预算下基准测试能支持与不能支持哪些安全主张的闭式界,并对照这一边界审计了现有评估套件。

可验证的AI推理

Lobsters Hottest

文章讨论了可验证的AI推理的概念,探讨了可信认证和加密证明等方法,以确保AI生成输出的真实性和来源,而无需重新运行模型。