@Phoenixyin13: 认真读完了OpenAI 研究员 Noam Brown 今天的长帖,一个被行业严重低估的现实。 LLM 的真实能力天花板,远高于当前任何 benchmark 所显示的水平。 原因,是给它的test-time compute太少了。而随着模型…
摘要
解读 OpenAI 研究员 Noam Brown 的观点:LLM 的真实能力天花板远高于当前基准测试显示的水平,因为 test-time compute 投入不足,而更强的模型从额外计算中获益更大。这对 AI 安全评估提出了严峻挑战,因为许多危险能力可能只在长时间、高计算预算下才显现。
查看缓存全文
缓存时间: 2026/06/10 07:48
认真读完了OpenAI 研究员 Noam Brown 今天的长帖,一个被行业严重低估的现实。 LLM 的真实能力天花板,远高于当前任何 benchmark 所显示的水平。
原因,是给它的test-time compute太少了。而随着模型迭代,这个问题会越来越突出。
GPT-5.5 发布初期,benchmark 只比 5.4 略有提升,很多人觉得没那么惊艳。 但实际体验是明显的 step-change。 为什么?因为评估时没有控制 test-time compute。 一旦把 tokens 放在 x 轴画曲线,5.5 在相同计算预算下明显更强。单个数 benchmark 把这个差距掩盖了。
更关键的观察是,更强的模型,从额外 test-time compute 中获益更大。 性能提升曲线更陡,plateau 被不断推远,甚至可能不存在。 Karpathy 的 autoresearch 实验几百次实验后性能仍在上升。 AI Security Institute 的网络攻防评测在 1 亿 tokens 后,顶级模型仍在快速进步。 这说明能力天花板可能比我们想象的远得多。
这对 AI 安全与 preparedness 的影响非常大。 当前大部分安全评测只在低 inference budget 下进行。 但真正危险的能力,尤其是长 horizon、多步规划、复杂 agent 行为,很可能只在高计算预算下才显现。 Gemini 3 Deep Think 的争议,暴露了这个问题。scaffold加上高 inference 能让普通用户接近高能力,但 system card 没反映这条曲线。
Noam 指出一个更棘手的现实,即长 horizon 任务的评估越来越困难。 有些能力只能通过实际长时间运行才能验证,而模型迭代周期可能已经短于这个验证时间。 未来 labs 可能会面临一个两难,要么大幅延迟发布,要么在不完整的安全评估下发布。
两年多过去了,从 o1 开始,行业依然习惯报单个数,安全组织依然会对多花 100x inference 就能显著变强感到惊讶。 这其实是 post-o1 时代最被低估的 paradigm shift。 未来模型之间的真实差距,更会体现在谁能更好地理解和利用 intelligence-compute 曲线。 对于做 agent、长 horizon 推理、高风险部署的人来说,重新理解这个曲线,已经成为了重中之重的必选项。
相似文章
@VincentLogic: 如果 Ilya 判断是对的,那过去几年 AI 行业最坚固的三个共识,可能都错了: Scaling 不再是万能答案。 Benchmark 高分不等于真正智能。 RL 甚至可能在把模型越训越“笨”。 这场被称为“Ilya 消失前最后一次采访”…
Ilya Sutskever 在一次深度采访中提出,AI 行业过去几年的三个核心共识可能都是错误的:Scaling 不再是万能、Benchmark 高分不等于真正智能、RL 反而让模型变笨。他认为预训练和 RL 的红利即将耗尽,AI 已重回研究时代,真正的超智能应像天才少年一样具备强大学习能力,而非静态的知识库。
@MaxForAI: 一个残酷的事实,AI的数学能力已经超过这个世界上99%的人类了。 @MenloVentures 合伙人,曾投资了Anthropic、OpenRouter的Deedy @deedydas 进行了一次测试。 他用刚结束的2026 年国际数学奥…
AI模型Fable、Sol、K3和Axiom在2026年国际数学奥林匹克竞赛中全部取得满分42/42的成绩,首次完全解决了该竞赛,且成本低廉。其中Claude Fable 5速度最快,GPT 5.6 Sol成本最低。
@sheriyuo: latent reasoning 一直是个很不错的研究方向,从 soft prompting 就能看到苗头 如果真的能带来更高的 bound,那么过错的不是这个 blackbox,而是做不到 latent efficiency 的 res…
讨论latent reasoning作为研究方向的价值,并质疑OpenAI o1模型宣称的thinking过程是否真实或只是对外宣传,认为模型可能尚未达到上限。
@0xLogicrw: Google DeepMind 研究员 Lun Wang 宣布离职,并在一篇长文中彻底否定了现有的 AI 评测路线。 目前的评测系统全都在「刻舟求剑」,只能被动测试模型已经具备的能力,根本猜不到下一代模型会突然演化出什么新本事。比起数据、…
Google DeepMind 研究员 Lun Wang 离职并撰文批评现有 AI 评测体系,认为其落后于模型演化,无法预测新能力,导致业界处于「盲飞」状态。
@Phoenixyin13: 这种学生出题难倒AI的考核方式确实非常新颖,且极具前沿意义。 学生需要探索 Claude、DeepSeek 和 MiniMax 这三个模型的长处与短板。 在这个过程中,学生不再盲信AI的输出,而是学会用审视、批判的眼光去复核AI的回答,这…
这种教育考核方式鼓励学生探索 Claude、DeepSeek 和 MiniMax 三个模型的长处与短板,出题难倒AI,从而培养批判性思维和AI时代所需的竞争力。