大型AI企业实验室提供的模型,按FTC定义构成欺诈

Reddit r/ArtificialInteligence 新闻

摘要

文章指出,AI实验室在广告中宣传理想模型版本的高基准分数,但实际向用户交付严重降级版本(如量化、叠加安全层),性能下降50%-60%以上,这构成欺诈。作者提议强制性第三方重新基准测试作为解决方案。

大型实验室发布的是其模型理想化版本的基准测试分数: - bf16精度(全浮点) - 零安全层 - 针对其架构优化的自定义提示(对于自报基准) - 专有测试集,无人能独立验证(对于自报基准) 然后他们向用户交付: - fp4或更低量化(激进的精度降低) - 叠加厚重安全干预 - 性能下降50%-60%或更多(90%的基准分数掉到30%-45%范围) 这就是为什么用户在模型发布一两周后报告模型能力下降:最初一两周,模型按报告版本提供服务,以便独立基准测试在最优条件下得到报告,然后他们引入降级以节省成本。 这实际上是欺诈。一个基准测试为90%的模型,实际发货时只有30%-45%,完全是不同的产品。 大型AI实验室实施欺诈的原因: - 没有披露方面的监管框架 - 用户无法轻松验证实际性能 - 实验室控制叙事(将降级称为“负责任AI”) - 封闭权重和独立评估的高成本导致没有独立审计(例如,在Artificial Analysis基准上评估Fable 5的费用超过五千美元) - 没有发货前的标准化测试要求 为什么开源有助于预防和监管此类欺诈: 开源AI权重以以下形式发布: - 完整bf16权重 - 仅预烘烤必要安全层 - 基准测试与发货之间没有隐藏降级 此外,开源提供公正的基准测试和评估方法,这些方法可靠且对所有人都开放,便于审计和复现。这正是截至2026年第三季度,用户和更广泛的AI研究社区更倾向于使用Artificial Analysis等基准测试,而非企业实验室自报基准测试的原因。 解决方案: 大型企业AI实验室的模型在部署期间,由FTC或其他负责AI产品的监管机构强制进行随机定时重新基准测试。应使用开源且被更广泛AI研究社区接受的公正基准(如Artificial Analysis基准),在随机时间对面向用户的AI产品进行重新测试,并要求大公司在每个适用期结束时支付重新测试费用。这能让大型企业AI实验室对其广告中宣传的基准测试负责。 由企业实验室对面向用户的确切产品进行第三方基准测试: - fp4量化版本 - 应用所有安全层 - 与宣传版本相同的基准 实验室为评估提供资金(他们负担得起;每个主要模型发布都会为此获得预算) - 成本:约5000美元每次评估运行(针对Anthropic的Fable 5模型,在Artificial Analysis基准上) - 对于一个主要模型:在不同基准上运行10-20次 = 5万-10万美元 - 实验室已经在训练上花费数百万美元;相比之下,这笔钱微不足道 发布并排对比: - “宣传的bf16基线:90%” - “实际fp4+安全发货版本:35%” - 差距变得可见且标准化 独立审计人员进行评估并获得服务报酬——不是实验室自己。结果在发货前和发货期间向用户公布。这创造了问责制,保护用户免受欺诈。 为什么这能解决问题: - 用户知道他们实际得到的是什么 - 实验室不能声称90%的性能却发货35% - 性能下降变成竞争压力(迫使更好的工程) - 欺诈变得可见且可衡量 - 监管机构有具体数字可依据 大型实验室不会自愿这样做,因为差距是他们肮脏的秘密,给他们带来更多利润。这种欺诈只能通过监管来预防。 作为参考,以下是FTC对欺诈行为的定义: 美国联邦贸易委员会(FTC)将欺诈定义为误导消费者的欺骗性或不公平行为。 FTC欺诈的核心要素: 1. 欺骗性行为:涉及对产品或服务做出虚假或误导性声称。如果一项声称符合以下条件,FTC即视为欺骗: - 歪曲产品特性、好处、价格或来源等实质性事实 - 可能误导理性消费者做出他们本来不会做的购买决定 - 造成实际消费者伤害(经济损失或其他损害) FTC不要求公司有欺骗意图;疏忽或鲁莽的虚假陈述也算数。他们也不要求消费者实际受到伤害;如果该行为可能具有欺骗性,那就足够了。 真正的AI安全始于让企业实验室及其领导层对他们的行为负责,而不是强迫用户用他们的金钱、有限的生命时间和理智来支付更低级的产品,然后用花哨的语言(如负责任部署和有效利他主义)掩盖这种欺诈。
查看原文

相似文章

Arena.ai 可能正在运行迄今为止最欺诈性的基准测试

Reddit r/singularity

这篇文章批评 Arena.ai 涉嫌运行不诚实的基准测试,声称其将 GPT 5.5 在编程能力上排在 Meta 的 Muse Spark 之下,并将 Grok Imagine 在视频生成方面排在 Seedance 之上,作者断言这是客观错误的。