@46ge5: 判断一个 AI Lab/组/部门的水平,最有价值的指标不是有没有 sota 模型,或者模型排在榜单什么位置,而是“灌水论文率” sota 模型反映的是一时的水平,而灌水率才能看出一个lab的风气、研究品味、是否有远期目标和价值观,乃至一个…
摘要
推文指出,评估AI实验室的水平不应只看SOTA模型,而应关注"灌水论文率",并评论Meta AI内部的风气问题及Alexandr Wang取代Yann的贡献。
查看缓存全文
缓存时间: 2026/06/04 03:59
判断一个 AI Lab/组/部门的水平,最有价值的指标不是有没有 sota 模型,或者模型排在榜单什么位置,而是“灌水论文率”
sota 模型反映的是一时的水平,而灌水率才能看出一个lab的风气、研究品味、是否有远期目标和价值观,乃至一个公司的发展(Meta AI 就是最典型例子,养了太多田渊栋那种大水比,真到了在 LLM 上拼刺刀的时候,一个挑大梁的都没有)
所以很多人低估了 alexandr wang,他取代 Yann,大刀阔斧砍掉那些蛀虫,就已经是天大的贡献
相似文章
@snowboat84: https://x.com/snowboat84/status/2070656715515932930
这篇文章详细介绍了AI for Science(AI4S)的新范式,从AI作为分析工具到科研智能体(scientific agents)的转变,阐述了自主性层级、关键案例和未来趋势。
@FinanceYF5: 有人对每个AI模型进行了排名
有人对所有AI模型进行了排名,提供了全面的比较评估。
@svpino:中国的人工智能生态系统与其他国家不同:每家公司都想发布自己的SOTA模型,但它们都…
该推文讨论了中国的人工智能生态系统,公司之间相互竞争但都发布开源模型。文中提到OpenRouter上出现了一个神秘模型'Owl Alpha',后被发现是美团的LongCat-2.0,这是一个1.6万亿参数模型,约480亿激活参数,针对推理和工具调用进行了优化。
@AYi_AInotes: 说个反常识的判断, 80% 的 Agent 生产崩溃,跟模型智商没半毛钱关系, 基本都死在上下文溢出、工具调错、子代理失控上, 2026 年真正的分水岭在 Harness 和 Loop,不是模型啊, 兄弟@wizardly_ai 这篇工程…
这篇文章指出80%的AI Agent生产崩溃并非模型智商问题,而是由上下文溢出、工具调错、子代理失控引起。作者强调2026年的分水岭在于Harness(办公室制度、安保系统)和Loop(自动循环机制),而非模型本身。
@Phoenixyin13: 认真读完了OpenAI 研究员 Noam Brown 今天的长帖,一个被行业严重低估的现实。 LLM 的真实能力天花板,远高于当前任何 benchmark 所显示的水平。 原因,是给它的test-time compute太少了。而随着模型…
解读 OpenAI 研究员 Noam Brown 的观点:LLM 的真实能力天花板远高于当前基准测试显示的水平,因为 test-time compute 投入不足,而更强的模型从额外计算中获益更大。这对 AI 安全评估提出了严峻挑战,因为许多危险能力可能只在长时间、高计算预算下才显现。