@josephdecker: 我的16款模型评测中,冠军在审计中被发现编造了5次。第二名仅差0.1分,零编造……

X AI KOLs Timeline 新闻

摘要

Joseph Decker 为他的产品 Condensr 评估了16个AI模型的真实性,发现排行榜冠军在审计中五次编造内容,于是转而部署了零编造的第二名模型。这篇文章详细介绍了评估过程、LLM判断器中的一个漏洞(由于截断的转录而惩罚了准确的摘要),以及自定义评估优于通用基准的重要性。

我的16款模型评估中的优胜者在审计中编造了5次。第二名仅差0.1分,零编造。部署了第二名。https://t.co/nTdxsKzuH5
查看原文
查看缓存全文

缓存时间: 2026/07/24 23:20

我16个模型评估的胜出者在审计中被发现编造了5次。第二名,仅落后0.1分:零编造。我部署了那个第二名。https://t.co/nTdxsKzuH5


赢得排行榜的模型并不是我部署的那个

我如何针对 condensr 的真实工作负载,评估了16个模型在真实性、准确性和精确度上的表现——以及为什么最高分反而输了。

Condensr 只有一项任务:帮你观看视频,并告诉你它们实际说了什么。这意味着底层的模型也只有一项任务:不要编造任何东西。一个会编造事实的摘要比没有摘要更糟糕,因为你无法分辨哪句话是编造的。

早在六月份,我就不再假设生产环境中的模型是好的,而是让16个模型在我自己的数据上证明自己。这是完整的过程:差点污染结果的评估 bug、四人评委团、盲测 lineup、最后的对抗性审计,以及为什么得分最高的模型并非今天运行在生产环境中的那个。

从你自己的数据开始

公共基准测试衡量的是基准性能。我需要知道模型如何处理 condensr 的实际工作负载:我通过产品处理过的真实视频——教程、商业分析、健康科普、访谈、评论——以及从40k到148k字符不等的杂乱语音转文字稿。事实证明,这些杂乱内容正是问题所在。

30个视频。来自5个提供商(OpenAI、Anthropic、Google、xAI,以及通过 OpenRouter 访问的 DeepSeek / Mistral / Llama / Qwen)的16个模型。每个模型对每个视频进行摘要。

一个看似不起眼但至关重要的细节:没有任何候选模型收到通用的“总结这个视频”提示。每次生成都使用了 condensr 实际生产提示流水线——真实的系统提示加上该视频在生产环境中会使用的按类别模板。如果一个评估让模型在一个它实际不会坐的座位上试镜,那么它告诉你的就是错误座位的表现。这30个视频还按类别进行了分层,轮转覆盖各个类别,因此这个集合并非暗中是30个技术视频。

第一步:发现你的评委在说谎

没人会手动评分480份摘要,所以由一个LLM评委根据原文逐份评分。但评委在模型犯错之前就先失败了。

评委提示的早期版本将原文截断到8000个字符以节省token。端倪是最详细的摘要得分最低——对于读起来明显忠实的内容,得分只有65%左右。深入调查后发现:评委在它能看到的原文片段中寻找摘要中的声明,找不到,就把它们算作编造。当对照完整原文评分时,同样的摘要得了97分。评委之所以指责最佳输出在撒谎,是因为我隐藏了证据。

这是第一课,也是最重要的一课:拥有部分证据的LLM评委会产生自信但错误的判决。始终传递完整的源材料。如果这让评估变得昂贵,那就是一个可信评估的代价。

这个bug现在已成为评委提示中的一个永久规则,也是我整个框架中最喜欢的一句:评委不得声称编造,除非它能指出被编造的短语并确认它在原文中不存在。改写、清理过的语音转文字以及正确的推断不是编造。不确定时,视为有依据。评委必须做我当初发现它撒谎时所做的工作。

评委实际做什么

“LLM评委”听起来有点笼统,所以这里给出机制。每个视频类别都有一个评分标准——一个简短的列表,描述该类别的优质摘要应包含哪些内容。评委对每个标准打分0、1或2,摘要的得分是所得分数除以可能分数。

两条规则保证了评分标准的诚实:

  • 只有当标准的内容基于原文时才视为满足。一个结构完美但编造事实的章节得0分,并且还会额外违反忠实性标准。

  • 只有当视频确实缺乏该内容时,标准才能标记为N/A——而不是摘要遗漏了它。N/A的标准会从分母中移除,因此摘要不会因为一个评论视频没有可提取的有序步骤而受到惩罚。忠实性本身永远不能是N/A。

在API允许的情况下,评委以温度0运行,使用强制JSON输出,并在遇到速率限制时进行退避重试。还有一个处理垃圾内容的硬性规则:评委响应无法解析或缺少分数时,先重试,然后丢弃。一个默默返回无意义内容的评委绝不能污染评估。

四个评委,因为一个意见就是偏见

每个摘要都接受来自四个不同模型家族的评委小组评分:gpt-5.4-mini、grok-4.3、claude-opus-4.8 和 gemini-3.1-pro。其中两个通过API按单个单元格运行;另外两个通过我已经付费的CLI订阅批量运行,这使预计的API账单从大约146美元降至大约54美元。

从评委小组中得到两个数字:

  • 共识——四位评委的平均分。质量分数。

  • 分歧——最高分减去最低分。偏差警报。一个得96分、分歧为2的模型是真实的96分。一个得96分、分歧为12的模型意味着评委们在打架,你应该亲自去读一下摘要。

(是的,两个评委同时也是参赛者。评委小组就是缓解措施——而且值得一提的是,gpt-5.4-mini自己的评委给了自己98分,而Opus给了它99分。没人能慷慨地给自己的作业打分。)

盲测 lineup

两个订阅评委是框架变得有趣的地方。Opus和Gemini Pro运行在我已经付费的套餐上,而不是API积分——框架真的从子进程环境中移除了API密钥,这样CLI调用就不能悄悄地使用API计费而不是套餐计费。两个套餐都有速率限制,所以不是每个摘要调用一次,而是每次调用一次性评分一个视频的所有16个摘要。

这种批处理带来了一个意外的方法论优势:lineup是盲测的。16个摘要被标记为A到P,使用从视频ID派生的种子进行打乱——确定性,因此恢复运行会重现相同的lineup,但被打乱,因此没有模型总是排在第一个并收集位置偏差。评委永远不会看到模型名称,批处理提示告诉评委根据每个摘要自身的忠实性进行评分,并且永远不要因为一个摘要与其他摘要一致而奖励它。

(一个听起来很蠢但非常真实的约束:一个180k字符的原文无法放入命令行参数。提示通过stdin传入。这些事情你只会经历一次。)

设计为可中断恢复

运行状态保存在三个JSON文件中——生成结果、API评委评分、CLI评委评分——每次写入都是先写入临时文件然后原子重命名,因此写入中途中断不会损坏状态并强制进行完整的、已付费的重新生成。每个阶段都可以独立运行,重新运行会跳过任何已完成的内容。

这种设计在编写当天就得到了使用:API积分在运行中耗尽(充值后恢复),一个评委在8路并发时开始抛出429错误(降到4路,恢复,清理剩余),三个单元格因最长原文的每个请求token上限而永久死亡。并发常量仍然在注释中留下了伤疤:“从8降低。”如果你的评估框架不能恢复,你将两次支付相同的token费用。

排行榜

有三件事引人注目:

  • 原任模型排名第9。gemini-2.5-flash,实际在生产中总结视频的模型,得分为94.5——落后于一个开放权重的DeepSeek,而后者价格大约只有其三分之一。

  • 在顶部,价格什么也没买到。gpt-5.5每千次摘要154美元,与gpt-5.4-mini的15.59美元并列。成本十倍,延迟五倍,分数只差0.1分。

  • grok-4.3在分数上获胜,每次摘要8秒。部署它,对吧?

分数看不到撒谎

平均质量分数恰恰淡化了我最关心的事情。一个在其他方面优秀的摘要中编造了一个公司名称,几乎不会影响平均值——而这正是读者停止信任产品的全部原因。

因此,最后阶段进入了对抗性模式。我拿出了6个最难的视频,派出了18个独立的审计代理——每个模型-视频对一个,3个模型×6个视频,因此没有审计代理会锚定在另一个的结论上——检查每个摘要中的每个声明是否与完整原文相符,专门寻找编造。三个模型接受了审计:原任模型和前两名。

原任模型编造得最多,其标志性动作是这个产品类别中最可怕的失败模式:名称补全。语音转文字听到了“ComFAC”;摘要说了Compaq。“Knight Ritter”变成了Knight Ridder。一个火箭推力的数字获得了演讲者从未给出的精确度。每一条都看起来像能力——每一条都是模型断言了源材料从未说过的东西。尽管我专门针对名称补全添加了一个提示防护,它仍在继续这样做。提示会减少这种倾向,但不会消除它。

grok-4.3,分数胜出者,编造了五次——包括完全相同的Compaq错误。

gpt-5.4-mini在所有六个视频中编造了零次,并且以正确的方式处理了同样混乱的语音转文字:TrueNAS、WireGuard和“Louis Ignarro”都被清理了,而没有断言上下文不支持的任何内容。

选择

gpt-5.4-mini。在排行榜上落后第二名0.1分,但在重要的事情上排第一:

  • 对抗性审计中0次编造(原任模型有9次)

  • 整个矩阵中评委一致性最紧(分歧为2)

  • 比原任模型更快——14秒 vs 19秒

  • 每份摘要0.0156美元 vs 0.0085美元——多花不到一分钱来停止编造

它在六月份部署,并且是今天为每个condensr视频做摘要的模型。

如果你想借鉴这个过程

  • 在你自己的数据上评估,而不是基准测试。失败模式存在于你数据的混乱中。

  • 通过你真实的生产提示运行候选模型。让模型在它实际会占据的座位上试镜。

  • 在模型之前先评估评委。始终传递完整源材料。截断的评委会冤枉无辜。

  • 使用跨模型家族的评委小组,盲测lineup,并跟踪分歧,而不仅仅是平均值。

  • 准确性和真实性是不同的测量维度。排行榜告诉你摘要是否好。只有声明级别的对抗性审计才能告诉你它们是否真实。

  • 原任模型是参赛者,而不是基线。我的原任模型排名第9,编造最多。

  • 在需要之前就让框架可恢复。

  • 价格不是质量的代理。10倍成本的模型打成平手。胜出者每份摘要花费一分半。

整个框架大约1300行Python:每个提供商一个生成适配器、评委小组、以及可恢复的矩阵运行器。里面没有什么巧妙之处。所有内容都是偏执的。对于评估来说,这是正确的比例。

以前选择模型是阅读基准测试和X上的氛围。现在只是运行评估。

相似文章

换一个裁判,分数就变了:审计大模型作为裁判的可靠性

arXiv cs.CL

本文审计了大模型作为裁判(LLM-as-judge)评估的可靠性,表明即使候选回复固定不变,更换评估模型也可能改变评分。论文考察了Qwen3和MiniMax模型的扩展与升级路径,得出结论:裁判升级不可互换,并提出了最佳报告实践。

大型AI企业实验室提供的模型,按FTC定义构成欺诈

Reddit r/ArtificialInteligence

文章指出,AI实验室在广告中宣传理想模型版本的高基准分数,但实际向用户交付严重降级版本(如量化、叠加安全层),性能下降50%-60%以上,这构成欺诈。作者提议强制性第三方重新基准测试作为解决方案。

TruthfulQA:衡量模型模仿人类虚假信息的程度

OpenAI Blog

# TruthfulQA:衡量模型模仿人类虚假信息的程度 来源:[https://openai.com/index/truthfulqa/](https://openai.com/index/truthfulqa/) ## 摘要 我们提出了一个基准来衡量语言模型在生成问题答案时是否真实。该基准包含817个问题,跨越38个类别,包括卫生、法律、金融和政治。我们精心设计了一些问题,其中一些人会因为错误的信念或误解而错误地回答。要表现良好,模型必须

并非每项评估都需要运行

arXiv cs.LG

这篇研究论文表明,前沿AI模型在133个基准测试上的得分近似于秩为2,即仅两个潜在因素就解释了超过90%的方差。作者提出了BenchPress,一种在logit空间中进行矩阵补全的方法,仅需少数几个基准测试就能预测模型的完整得分表,从而显著降低评估成本。