@huangyihe: 以顾问身份加入腾讯时,姚顺雨任务只有一个:排查混元大模型长期落后的原因。排查结果是:“简单来说,几乎每个环节都在漏水。” 混元过度追求榜单成绩,把打榜语料放进训练集污染了数据,模型变得很会考试,但在真实场景表现很差。当时数据标注准确率的验…
摘要
腾讯顾问姚顺雨排查混元大模型落后面原因,发现为追求榜单成绩导致数据污染、标注质量差等系统性问题。
以顾问身份加入腾讯时,姚顺雨任务只有一个:排查混元大模型长期落后的原因。排查结果是:“简单来说,几乎每个环节都在漏水。” 混元过度追求榜单成绩,把打榜语料放进训练集污染了数据,模型变得很会考试,但在真实场景表现很差。当时数据标注准确率的验收线定在 95% ,实际却长期停留在 60%-70%,团队为了交差生产出大批无法使用的数据,算法团队默许了这一切。
来自《晚点》。
查看缓存全文
缓存时间: 2026/07/14 10:22
以顾问身份加入腾讯时,姚顺雨任务只有一个:排查混元大模型长期落后的原因。排查结果是:“简单来说,几乎每个环节都在漏水。” 混元过度追求榜单成绩,把打榜语料放进训练集污染了数据,模型变得很会考试,但在真实场景表现很差。当时数据标注准确率的验收线定在 95% ,实际却长期停留在 60%-70%,团队为了交差生产出大批无法使用的数据,算法团队默许了这一切。
来自《晚点》。
相似文章
@latepostnews: 29岁姚顺雨空降:改造腾讯混元的 300 天 - 2024 年,腾讯的高招团队在一场顶级学术会议上认识了姚顺雨。当时这个 97 年的年轻人还是 OpenAI 的研究员,他被介绍给了腾讯总裁刘炽平。一年后,他回国,一跃成为了腾讯的大语言模型…
腾讯混元大模型在姚顺雨带领下进行深度改革:简化层级、聚焦数据质量、放弃打榜,目标2027年进入国内第一梯队。文章详细描述了姚顺雨从OpenAI空降腾讯后300天内推动的变革,包括换掉关键负责人、强化基础建设、推行模型与产品联合设计(Co-design)等。
@MaxForAI: 看了前Qwen研究员 Hongyi Yuan @yiguyuan20 的发言我才明白为什么中国大厂的基础模型做不起来了。。。 感情指出错误或者说真话都得要论资排辈啊 如果这样的话,那一个刚毕业或者实习生哪有资格(哪里敢)对于训练提出异议或…
前Qwen研究员Hongyi Yuan的言论揭示了中国大厂基础模型研发中的论资排辈文化,限制了新人提出异议和创新,导致模型难以突破。
@Sxy_Cherotich: 最近找了蛮多 model researchers 交流,一个共识结论是:数据的重要性再次凸显。 前阵子认识了 ex-kimi,在做数据方向创业的@FanqingMengAI,请他来录了一期播客。 聊出的一个最大非共识,是繁青对国内外模型差…
一篇关于AI模型竞争的播客内容,讨论数据重要性、蒸馏与预训练创新,以及与Evolvent AI联创孟繁青的访谈,涉及合成数据、RSI和国内模型差异等话题。
@AYi_AInotes: 说个反常识的判断, 80% 的 Agent 生产崩溃,跟模型智商没半毛钱关系, 基本都死在上下文溢出、工具调错、子代理失控上, 2026 年真正的分水岭在 Harness 和 Loop,不是模型啊, 兄弟@wizardly_ai 这篇工程…
这篇文章指出80%的AI Agent生产崩溃并非模型智商问题,而是由上下文溢出、工具调错、子代理失控引起。作者强调2026年的分水岭在于Harness(办公室制度、安保系统)和Loop(自动循环机制),而非模型本身。
@jakevin7: 现在的模型感觉都有点大病,得了注释狂魔症.... 会导致很大问题,很多过时的信息被注入到代码里作为上下文,并且这还是agent自主做的不可控的。
作者吐槽当前AI模型普遍有过度添加注释的倾向,导致过时信息被注入代码上下文,且由agent自主完成,存在失控风险。