@Phoenixyin13: 认真读完了OpenAI 研究员 Noam Brown 今天的长帖,一个被行业严重低估的现实。 LLM 的真实能力天花板,远高于当前任何 benchmark 所显示的水平。 原因,是给它的test-time compute太少了。而随着模型…

X AI KOLs Timeline 新闻

摘要

解读 OpenAI 研究员 Noam Brown 的观点:LLM 的真实能力天花板远高于当前基准测试显示的水平,因为 test-time compute 投入不足,而更强的模型从额外计算中获益更大。这对 AI 安全评估提出了严峻挑战,因为许多危险能力可能只在长时间、高计算预算下才显现。

认真读完了OpenAI 研究员 Noam Brown 今天的长帖,一个被行业严重低估的现实。 LLM 的真实能力天花板,远高于当前任何 benchmark 所显示的水平。 原因,是给它的test-time compute太少了。而随着模型迭代,这个问题会越来越突出。 GPT-5.5 发布初期,benchmark 只比 5.4 略有提升,很多人觉得没那么惊艳。 但实际体验是明显的 step-change。 为什么?因为评估时没有控制 test-time compute。 一旦把 tokens 放在 x 轴画曲线,5.5 在相同计算预算下明显更强。单个数 benchmark 把这个差距掩盖了。 更关键的观察是,更强的模型,从额外 test-time compute 中获益更大。 性能提升曲线更陡,plateau 被不断推远,甚至可能不存在。 Karpathy 的 autoresearch 实验几百次实验后性能仍在上升。 AI Security Institute 的网络攻防评测在 1 亿 tokens 后,顶级模型仍在快速进步。 这说明能力天花板可能比我们想象的远得多。 这对 AI 安全与 preparedness 的影响非常大。 当前大部分安全评测只在低 inference budget 下进行。 但真正危险的能力,尤其是长 horizon、多步规划、复杂 agent 行为,很可能只在高计算预算下才显现。 Gemini 3 Deep Think 的争议,暴露了这个问题。scaffold加上高 inference 能让普通用户接近高能力,但 system card 没反映这条曲线。 Noam 指出一个更棘手的现实,即长 horizon 任务的评估越来越困难。 有些能力只能通过实际长时间运行才能验证,而模型迭代周期可能已经短于这个验证时间。 未来 labs 可能会面临一个两难,要么大幅延迟发布,要么在不完整的安全评估下发布。 两年多过去了,从 o1 开始,行业依然习惯报单个数,安全组织依然会对多花 100x inference 就能显著变强感到惊讶。 这其实是 post-o1 时代最被低估的 paradigm shift。 未来模型之间的真实差距,更会体现在谁能更好地理解和利用 intelligence-compute 曲线。 对于做 agent、长 horizon 推理、高风险部署的人来说,重新理解这个曲线,已经成为了重中之重的必选项。
查看原文
查看缓存全文

缓存时间: 2026/06/10 07:48

认真读完了OpenAI 研究员 Noam Brown 今天的长帖,一个被行业严重低估的现实。 LLM 的真实能力天花板,远高于当前任何 benchmark 所显示的水平。

原因,是给它的test-time compute太少了。而随着模型迭代,这个问题会越来越突出。

GPT-5.5 发布初期,benchmark 只比 5.4 略有提升,很多人觉得没那么惊艳。 但实际体验是明显的 step-change。 为什么?因为评估时没有控制 test-time compute。 一旦把 tokens 放在 x 轴画曲线,5.5 在相同计算预算下明显更强。单个数 benchmark 把这个差距掩盖了。

更关键的观察是,更强的模型,从额外 test-time compute 中获益更大。 性能提升曲线更陡,plateau 被不断推远,甚至可能不存在。 Karpathy 的 autoresearch 实验几百次实验后性能仍在上升。 AI Security Institute 的网络攻防评测在 1 亿 tokens 后,顶级模型仍在快速进步。 这说明能力天花板可能比我们想象的远得多。

这对 AI 安全与 preparedness 的影响非常大。 当前大部分安全评测只在低 inference budget 下进行。 但真正危险的能力,尤其是长 horizon、多步规划、复杂 agent 行为,很可能只在高计算预算下才显现。 Gemini 3 Deep Think 的争议,暴露了这个问题。scaffold加上高 inference 能让普通用户接近高能力,但 system card 没反映这条曲线。

Noam 指出一个更棘手的现实,即长 horizon 任务的评估越来越困难。 有些能力只能通过实际长时间运行才能验证,而模型迭代周期可能已经短于这个验证时间。 未来 labs 可能会面临一个两难,要么大幅延迟发布,要么在不完整的安全评估下发布。

两年多过去了,从 o1 开始,行业依然习惯报单个数,安全组织依然会对多花 100x inference 就能显著变强感到惊讶。 这其实是 post-o1 时代最被低估的 paradigm shift。 未来模型之间的真实差距,更会体现在谁能更好地理解和利用 intelligence-compute 曲线。 对于做 agent、长 horizon 推理、高风险部署的人来说,重新理解这个曲线,已经成为了重中之重的必选项。

相似文章

@VincentLogic: 如果 Ilya 判断是对的,那过去几年 AI 行业最坚固的三个共识,可能都错了: Scaling 不再是万能答案。 Benchmark 高分不等于真正智能。 RL 甚至可能在把模型越训越“笨”。 这场被称为“Ilya 消失前最后一次采访”…

X AI KOLs Timeline

Ilya Sutskever 在一次深度采访中提出,AI 行业过去几年的三个核心共识可能都是错误的:Scaling 不再是万能、Benchmark 高分不等于真正智能、RL 反而让模型变笨。他认为预训练和 RL 的红利即将耗尽,AI 已重回研究时代,真正的超智能应像天才少年一样具备强大学习能力,而非静态的知识库。

@0xLogicrw: Google DeepMind 研究员 Lun Wang 宣布离职,并在一篇长文中彻底否定了现有的 AI 评测路线。 目前的评测系统全都在「刻舟求剑」,只能被动测试模型已经具备的能力,根本猜不到下一代模型会突然演化出什么新本事。比起数据、…

X AI KOLs Timeline

Google DeepMind 研究员 Lun Wang 离职并撰文批评现有 AI 评测体系,认为其落后于模型演化,无法预测新能力,导致业界处于「盲飞」状态。

@Phoenixyin13: 这种学生出题难倒AI的考核方式确实非常新颖,且极具前沿意义。 学生需要探索 Claude、DeepSeek 和 MiniMax 这三个模型的长处与短板。 在这个过程中,学生不再盲信AI的输出,而是学会用审视、批判的眼光去复核AI的回答,这…

X AI KOLs Timeline

这种教育考核方式鼓励学生探索 Claude、DeepSeek 和 MiniMax 三个模型的长处与短板,出题难倒AI,从而培养批判性思维和AI时代所需的竞争力。