@46ge5: 判断一个 AI Lab/组/部门的水平,最有价值的指标不是有没有 sota 模型,或者模型排在榜单什么位置,而是“灌水论文率” sota 模型反映的是一时的水平,而灌水率才能看出一个lab的风气、研究品味、是否有远期目标和价值观,乃至一个…

X AI KOLs Timeline 新闻

摘要

推文指出,评估AI实验室的水平不应只看SOTA模型,而应关注"灌水论文率",并评论Meta AI内部的风气问题及Alexandr Wang取代Yann的贡献。

判断一个 AI Lab/组/部门的水平,最有价值的指标不是有没有 sota 模型,或者模型排在榜单什么位置,而是“灌水论文率” sota 模型反映的是一时的水平,而灌水率才能看出一个lab的风气、研究品味、是否有远期目标和价值观,乃至一个公司的发展(Meta AI 就是最典型例子,养了太多田渊栋那种大水比,真到了在 LLM 上拼刺刀的时候,一个挑大梁的都没有) 所以很多人低估了 alexandr wang,他取代 Yann,大刀阔斧砍掉那些蛀虫,就已经是天大的贡献
查看原文
查看缓存全文

缓存时间: 2026/06/04 03:59

判断一个 AI Lab/组/部门的水平,最有价值的指标不是有没有 sota 模型,或者模型排在榜单什么位置,而是“灌水论文率”

sota 模型反映的是一时的水平,而灌水率才能看出一个lab的风气、研究品味、是否有远期目标和价值观,乃至一个公司的发展(Meta AI 就是最典型例子,养了太多田渊栋那种大水比,真到了在 LLM 上拼刺刀的时候,一个挑大梁的都没有)

所以很多人低估了 alexandr wang,他取代 Yann,大刀阔斧砍掉那些蛀虫,就已经是天大的贡献

相似文章

@AYi_AInotes: 说个反常识的判断, 80% 的 Agent 生产崩溃,跟模型智商没半毛钱关系, 基本都死在上下文溢出、工具调错、子代理失控上, 2026 年真正的分水岭在 Harness 和 Loop,不是模型啊, 兄弟@wizardly_ai 这篇工程…

X AI KOLs Timeline

这篇文章指出80%的AI Agent生产崩溃并非模型智商问题,而是由上下文溢出、工具调错、子代理失控引起。作者强调2026年的分水岭在于Harness(办公室制度、安保系统)和Loop(自动循环机制),而非模型本身。

@Phoenixyin13: 认真读完了OpenAI 研究员 Noam Brown 今天的长帖,一个被行业严重低估的现实。 LLM 的真实能力天花板,远高于当前任何 benchmark 所显示的水平。 原因,是给它的test-time compute太少了。而随着模型…

X AI KOLs Timeline

解读 OpenAI 研究员 Noam Brown 的观点:LLM 的真实能力天花板远高于当前基准测试显示的水平,因为 test-time compute 投入不足,而更强的模型从额外计算中获益更大。这对 AI 安全评估提出了严峻挑战,因为许多危险能力可能只在长时间、高计算预算下才显现。