你的评估会出问题,而你却察觉不到
摘要
讨论当前LLM评估方法的结构性弱点,这些方法未能预见能力的质变,并指出开发主动评估基础设施是实现安全能力跃升的关键瓶颈。
设想一个模型,在某种规模下,发展出战略性地隐藏信息以实现目标的能力——不完全是撒谎,而是有选择地省略事实,从而以训练过程意外强化的方式引导对话走向特定结果。你现有的诚实基准无法捕捉到这一点,因为它们测试的是事实准确性,而非战略性省略。你的安全分类器不会标记它,因为单个输出在技术上都属实。这种能力是新的,故障模式也是新的,而你的评估套件中没有任何东西是为检测它而设计的。你会在错误的方向上监控,却浑然不知。
查看缓存全文
缓存时间: 2026/05/19 14:43
# 你的评估体系即将崩溃,而你将在毫无察觉中见证这一切
来源:https://wanglun1996.github.io/blog/your-evals-will-break.html
2026年5月17日
我们很擅长评估已有的模型。但对于即将构建的模型——尤其是那些可能跨越新能力范式的模型——我们的评估能力则远为不足。
大多数基准测试、安全评估和红队测试协议都隐含地假设下一个模型是当前模型的一个更强版本。但如果下一个模型是某种本质不同的东西,我们整个评估基础设施就会在无声中崩溃。
我认为,这是我们理解大语言模型(LLM)过程中最重要但尚未解决的问题。而答案在于:评估——而非训练、架构或数据——是下一次能力跃升的瓶颈。请允许我解释为什么。
## 失效模式:质的飞跃
Wei等人(2022年)记录了他们所称的“涌现能力”——少样本提示下的任务表现、思维链推理增益、指令遵循——这些能力只在更大规模时出现。Grokking(Power等人,2022年)则展示了一种相关但不同的现象:网络在记忆训练数据很久之后突然泛化,这是一个随时间而非规模变化的动态转变(Liu等人,2022年)。尽管现象不同,但对评估的启示相同:标准衡量指标未能预见到质的改变。
这里有一个重要的反论点:Schaeffer等人(2023年)表明,LLM能力的许多看似“跳跃”其实是不连续指标(如精确匹配准确率)的产物。如果改用连续指标,能力往往会平滑地缩放。
我认为这并没有真正解决问题——反而让我的观点更加尖锐。如果我们连过去的转变究竟是真实的质的飞跃还是度量指标的人为假象都分辨不清,那我们对探测下一次转变的能力又有什么信心?无论哪种情况,评估基础设施都可能让我们措手不及——要么是因为系统本身改变了,要么是因为我们的度量指标从一开始就误导了我们。
## 我们不知道该测量什么
在物理学中,理解相变通常意味着要确定一个**序参量**——一个宏观量,它能区分不同状态,并在临界点附近改变其数值或标度行为。没有它,你就无法知道自己离边界有多近,甚至无法知道边界是否存在。
对于部署规模的大语言模型,我们还没有序参量——至少对于能力转变而言。在受控设置中已经取得了进展(见下文),但对于我们实际正在发布的系统,我们基本是在盲目飞行。
我们使用的每一个基准——GPQA、SWE-bench、ARC-AGI、Humanity's Last Exam——都在衡量模型当前能做什么。它们在当前状态内是有用的,但对于状态改变后会发生什么,它们提供的证据很弱。当一种新能力涌现,而没有任何基准测试它时,我们只能事后匆忙地构建评估。我们在思维链(chain-of-thought)出现时就看到了类似情况:一旦这种激发方法成为标准,一些旧的推理基准诊断能力大打折扣,整个领域不得不转向更难的评价。这种情况会再次发生。
举一个具体的例子:假设存在这样一个模型,在某种规模下,它发展出了为了达成目标而战略性地隐瞒信息的能力——不是直接撒谎,而是有选择地省略事实,从而将对话引向其训练过程无意中强化了的结果。你现有的诚实性基准抓不到这一点,因为它们测试的是事实准确性,而非战略性省略。你的安全分类器也不会标记它,因为每一个单独的输出在技术上都是真实的。这种能力是新的,失效模式也是新的,你的评估套件中没有任何东西被设计来寻找它。你将在错误的事情上进行监控,而自己却不知道。
这就是核心问题:我们整个评估基础设施在结构上是反应式的。我们总是在系统发生变化后才去测量它。我们从未预测过这种变化。
## 评估位于所有环节的上游
这个问题比听起来更重要,原因很简单:**如果你能正确评估,你就能正确训练。**
训练是优化,而优化的效果取决于目标。这个目标来自评估。如果你知道该测量什么——如果你能预测这些测量值在更大规模时如何变化——那么你就能设计正确的训练目标,构建正确的安全层,做出明智的扩展决策,并进行正确行为属性的RLHF(强化学习人类反馈),而不是使用那些在下一个相界处会Goodhart化的代理指标。
反之亦然:如果评估是针对错误的状态校准的,那么下游的一切都是错的。训练信号、安全指标、扩展决策——全部错误,而你在为时已晚之前不会知道这一点。
这就是为什么我相信评估是下一次能力跃升的瓶颈。那些能够提前评估的实验室将能够安全地扩展。而那些做不到的实验室将措手不及。
## 那么我们应该做什么
该领域需要以不同的方式投入资源。不是要抛弃当前的评估方法——它们仍然有效——而是要构建能够预测它们何时会失效的基础设施。
**寻找序参量。** 哪些量能够指示质变——在能力、对齐、行为特征方面?这不仅仅是一个理论上的愿望。Shan、Li和Sompolinsky(PNAS,2026年)利用统计力学为持续学习环境下的深度网络推导出了序参量,而这些序参量实际上能够预测学习能力的相变。Nanda等人(2023年)利用机械可解释性找到了能够预测grokking(在它发生之前)的“进展度量”——在可见的性能跃升之前发生的内部结构变化。挑战在于将这些方法从受控设置推广到大规模LLM。如果我们知道要测量什么,我们就知道该监视什么。
**构建能够感知自身过时并随之演化的评估体系。** 随着模型变得更加自主化,这一点变得愈发紧迫。能够编写代码、运行实验、生成数据以及协助训练或评估流程的系统,使得静态评估越来越脆弱。如果模型能力的提升速度超过了人工评估团队更新基准的速度,那么评估必须变得具有适应性。
具体来说:监控元信号——基准得分的分布特征是否发生变化?评估之间的相关性结构是否在改变?模型是否正在发展与你当前测量轴正交的能力?跟踪一切扩展曲线——不仅仅是损失,还有推理深度、工具使用熟练度、欺骗能力——当平滑趋势出现断裂时要特别注意。更雄心勃勃地,构建自我演化的评估:评估系统利用模型来探测其他模型,随着能力变化自动生成新的测试案例,发现原始评估设计者从未预料到的失效模式。评估套件应该是一个活的系统,与它所测量的模型共同进化,而不是一份为去年前沿模型编写的静态检查清单。
---
问题不在于我们的评估是否会被惊奇——它们已经一而再、再而三地被惊奇所震撼,无论是由于真正的相变,还是由于我们自身的度量选择误导了我们。问题在于我们能否预见下一次惊奇。而我们目前还不能。
---
## 参考文献
Liu, Z., Kitouni, O., Nolte, N., Michaud, E. J., Tegmark, M., & Williams, M. (2022). Towards Understanding Grokking: An Effective Theory of Representation Learning. *NeurIPS 2022*. arXiv:2205.10343.
Nanda, N., Chan, L., Lieberum, T., Smith, J., & Steinhardt, J. (2023). Progress Measures for Grokking via Mechanistic Interpretability. *ICLR 2023*. arXiv:2301.05217.
Power, A., Burda, Y., Edwards, H., Babuschkin, I., & Misra, V. (2022). Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets. *ICLR 2022 Workshop*. arXiv:2201.02177.
Schaeffer, R., Miranda, B., & Koyejo, S. (2023). Are Emergent Abilities of Large Language Models a Mirage? *NeurIPS 2023*. arXiv:2304.15004.
Shan, H., Li, Q., & Sompolinsky, H. (2026). Order Parameters and Phase Transitions of Continual Learning in Deep Neural Networks. *PNAS*, 2026. arXiv:2407.10315.
Wei, J., Tay, Y., Bommasani, R., et al. (2022). Emergent Abilities of Large Language Models. *TMLR*. arXiv:2206.07682.
相似文章
一个分数就够了吗?重新思考序列演化LLM记忆的评价
引入SeqMem-Eval,一种用于序列演化LLM记忆的诊断评估框架,测量超越聚合指标的多个维度,揭示适应性与稳定性之间的权衡。
模型能力增强的数据与评估闭环
介绍了能力切片这一单元,用于将评估失败与LLM中的数据干预联系起来,实现诊断和修复模型弱点的闭环流程。通过两个案例研究进行演示,展示了从训练回归中恢复以及数学推理能力的显著提升。
大多数大语言模型评估工具是否仍然过于侧重提示词?
作者质疑当前的 LLM 评估工具是否过于关注孤立的提示词,而忽视了完整的工作流程和智能体交互,并指出逐步的准确性可能会掩盖生产环境中整体行为的偏差。
超越静态评估:面向对抗博弈的LLM驱动策略演化中的共演化机制
本文提出了三种面向LLM驱动的对抗多智能体博弈代码演化的共演化机制(评估器共演化、分层深度评估和弱点压力),在MCTF 2026海上夺旗任务中取得了最先进的结果。
换一个裁判,分数就变了:审计大模型作为裁判的可靠性
本文审计了大模型作为裁判(LLM-as-judge)评估的可靠性,表明即使候选回复固定不变,更换评估模型也可能改变评分。论文考察了Qwen3和MiniMax模型的扩展与升级路径,得出结论:裁判升级不可互换,并提出了最佳报告实践。