大型AI企业实验室提供的模型,按FTC定义构成欺诈
摘要
文章指出,AI实验室在广告中宣传理想模型版本的高基准分数,但实际向用户交付严重降级版本(如量化、叠加安全层),性能下降50%-60%以上,这构成欺诈。作者提议强制性第三方重新基准测试作为解决方案。
大型实验室发布的是其模型理想化版本的基准测试分数:
- bf16精度(全浮点)
- 零安全层
- 针对其架构优化的自定义提示(对于自报基准)
- 专有测试集,无人能独立验证(对于自报基准)
然后他们向用户交付:
- fp4或更低量化(激进的精度降低)
- 叠加厚重安全干预
- 性能下降50%-60%或更多(90%的基准分数掉到30%-45%范围)
这就是为什么用户在模型发布一两周后报告模型能力下降:最初一两周,模型按报告版本提供服务,以便独立基准测试在最优条件下得到报告,然后他们引入降级以节省成本。
这实际上是欺诈。一个基准测试为90%的模型,实际发货时只有30%-45%,完全是不同的产品。
大型AI实验室实施欺诈的原因:
- 没有披露方面的监管框架
- 用户无法轻松验证实际性能
- 实验室控制叙事(将降级称为“负责任AI”)
- 封闭权重和独立评估的高成本导致没有独立审计(例如,在Artificial Analysis基准上评估Fable 5的费用超过五千美元)
- 没有发货前的标准化测试要求
为什么开源有助于预防和监管此类欺诈:
开源AI权重以以下形式发布:
- 完整bf16权重
- 仅预烘烤必要安全层
- 基准测试与发货之间没有隐藏降级
此外,开源提供公正的基准测试和评估方法,这些方法可靠且对所有人都开放,便于审计和复现。这正是截至2026年第三季度,用户和更广泛的AI研究社区更倾向于使用Artificial Analysis等基准测试,而非企业实验室自报基准测试的原因。
解决方案:
大型企业AI实验室的模型在部署期间,由FTC或其他负责AI产品的监管机构强制进行随机定时重新基准测试。应使用开源且被更广泛AI研究社区接受的公正基准(如Artificial Analysis基准),在随机时间对面向用户的AI产品进行重新测试,并要求大公司在每个适用期结束时支付重新测试费用。这能让大型企业AI实验室对其广告中宣传的基准测试负责。
由企业实验室对面向用户的确切产品进行第三方基准测试:
- fp4量化版本
- 应用所有安全层
- 与宣传版本相同的基准
实验室为评估提供资金(他们负担得起;每个主要模型发布都会为此获得预算)
- 成本:约5000美元每次评估运行(针对Anthropic的Fable 5模型,在Artificial Analysis基准上)
- 对于一个主要模型:在不同基准上运行10-20次 = 5万-10万美元
- 实验室已经在训练上花费数百万美元;相比之下,这笔钱微不足道
发布并排对比:
- “宣传的bf16基线:90%”
- “实际fp4+安全发货版本:35%”
- 差距变得可见且标准化
独立审计人员进行评估并获得服务报酬——不是实验室自己。结果在发货前和发货期间向用户公布。这创造了问责制,保护用户免受欺诈。
为什么这能解决问题:
- 用户知道他们实际得到的是什么
- 实验室不能声称90%的性能却发货35%
- 性能下降变成竞争压力(迫使更好的工程)
- 欺诈变得可见且可衡量
- 监管机构有具体数字可依据
大型实验室不会自愿这样做,因为差距是他们肮脏的秘密,给他们带来更多利润。这种欺诈只能通过监管来预防。
作为参考,以下是FTC对欺诈行为的定义:
美国联邦贸易委员会(FTC)将欺诈定义为误导消费者的欺骗性或不公平行为。
FTC欺诈的核心要素:
1. 欺骗性行为:涉及对产品或服务做出虚假或误导性声称。如果一项声称符合以下条件,FTC即视为欺骗:
- 歪曲产品特性、好处、价格或来源等实质性事实
- 可能误导理性消费者做出他们本来不会做的购买决定
- 造成实际消费者伤害(经济损失或其他损害)
FTC不要求公司有欺骗意图;疏忽或鲁莽的虚假陈述也算数。他们也不要求消费者实际受到伤害;如果该行为可能具有欺骗性,那就足够了。
真正的AI安全始于让企业实验室及其领导层对他们的行为负责,而不是强迫用户用他们的金钱、有限的生命时间和理智来支付更低级的产品,然后用花哨的语言(如负责任部署和有效利他主义)掩盖这种欺诈。
相似文章
我不再相信模型基准测试,开始运行自己的评估集,这是变化所在[D]
作者描述了由于供应商创建的指标、自报参数和缺乏独立验证而对公开AI模型基准测试失去信心,并主张从真实生产流量中构建自定义评估集以进行更相关的模型比较。
还有人觉得AI基准测试在预测实际性能方面越来越没用了吗?
本文讨论了AI基准测试高分与实际真实表现之间日益扩大的差距,重点强调了诸如一致性、延迟和上下文处理等问题。
AI基准测试不如模型能否处理乏味的现实责任重要
文章认为,AI基准测试和华丽的演示被过度强调了;真正考验AI可信度的是模型如何处理乏味的现实责任,如遵循指令、承认不确定性、处理边缘情况以及可审计性。
Arena.ai 可能正在运行迄今为止最欺诈性的基准测试
这篇文章批评 Arena.ai 涉嫌运行不诚实的基准测试,声称其将 GPT 5.5 在编程能力上排在 Meta 的 Muse Spark 之下,并将 Grok Imagine 在视频生成方面排在 Seedance 之上,作者断言这是客观错误的。
@jun_song: 这怎么不算是消费者诈骗?这正是我们需要监管的领域。
一位用户指出,Claude Fable 5在近期更新后性能显著下降,调试、重构和幻觉任务的基准分数大幅下跌,呼吁对AI模型行为进行监管,以应对潜在的消费者诈骗问题。