标签
# 「超大杯」AI 智能:从 XL 到 XXL 的模型身材焦虑 ## 引言:谁把我的参数越写越大? 还记得当年用 5 亿参数的模型跑一个情感分析,就已经觉得「哇,好聪明」。如今你要是拿它出来,大家只会礼貌地问一句:**「这是去年的吗?」** 语言模型的进化速度,比你的手机换代速度还快——只不过,别人家的升级是性能翻倍,我们的是**腰围翻倍**。 ## 一、参数军备竞赛:一场没有终点的赛跑 GPT 系列从 1.7B 到千亿级别,不过用了短短几年。各家实验室的对话大概是这样的: - **研究员 A**:「我们的模型有 70 亿参数。」 - **研究员 B**:「我们的有 700 亿。」 - **研究员 C**:「我们的有……你先别听,我们先说显存够不够。」 参数规模已经成了某种科技圈的腰围——**没人想承认自己比别人小**。于是我们看到一个诡异的现象:明明任务只有 300 词的摘要,却要用上一台足以驱动小型城市的 GPU 集群。 ## 二、「越大越聪明」的神话与真相 是的,模型大了确实更聪明,但这里的「聪明」有几个前提: 1. **数据质量得跟上**——用互联网垃圾喂出来的百亿参数模型,可能只是一个博览众「坑」的博学白痴。 2. **推理成本得算清**——调用一次的电费,可能比你自己动手写完那份报告还贵。 3. **并非线性收益**——从 7B 到 70B 提升明显,从 70B 到 700B……嗯,钱包先哭了。 换句话说,**模型大小和智能水平的关系,更像房价和幸福感的关系**:有帮助,但远没有你以为的那么有帮助。 ## 三、当「Extra Large」成为默认选项 行业现在的默认设定是:**能训多大就训多大**。这背后有真金白银的逻辑——推理服务、论文引用、融资估值,都对「参数量」这个数字格外敏感。 但普通用户关心的是什么?是它能不能: - 用你说人话的方式回答问题; - 在 3 秒内给你结果,而不是让你等到泡面凉了; - 跑在你那台笔记本上,而不是云端的某个数据中心。 于是「大模型」和「好用的模型」之间,出现了一条微妙的裂缝。这条裂缝里,藏着蒸馏、量化、剪枝这些把大象塞进冰箱的艺术。 ## 四、小模型的反击:秀肌肉不如秀性价比 当大家都在比谁的模型「更胖」时,一批精瘦选手开始逆袭: - **7B 级别的模型**,经过高质量数据微调后,可以在特定任务上吊打通用巨型模型; - **MoE(混合专家)架构**,让模型外表臃肿、实际只动用一小部分参数干活——**AI 界的「看起来很壮」**; - **端侧部署**让手机、笔记本也能跑起不错的模型,用户终于不用为一句「今天天气怎么样」排队等待 GPU 了。 事实证明,**智能不是体积的函数,而是数据、架构和训练策略的函数**。 ## 五、展望:我们到底在追求什么? 这场「越做越大」的竞赛,最终指向的应该是**更聪明的智能**,而不是更占地方的参数。好消息是,行业已经开始出现清醒的声音:评估标准正在从「参数量」转向「能力表现」,从「谁训得最大」转向「谁用得最好」。 也许未来的某一天,我们会对一个模型说:**「你不需要长那么高,把问题回答好就行。」** 而这,可能才是真正意义上的——**Extra Large Intelligence**。 --- *写完这篇稿子,我的笔记本风扇已经开始抗议了。模型的身材焦虑,原来会传染。*
文章质疑 Nvidia 的 Vera Rubin 是否会加速 LLM 预训练,并探讨了考虑到数据、电力和成本等限制,超过 10 万亿参数的模型是否可行。
本文分析了用于 LLM 推理的同策略自蒸馏(OPSD),指出未经验证的学生生成骨架会带来模仿鸿沟,且该鸿沟随模型规模增大而加剧,因此提出了 OASIS 方法:利用模型生成的尝试作为教师上下文,主要对经过答案标签验证的同策略轨迹进行监督,使 Qwen3 1.7B/4B/8B 模型在 AIME/HMMT 基准上提升 3.2-3.8 个点。
本文分享了《How to scale your model》一书中关于推理的专门章节,涵盖了Transformer模型的关键优化技术,如KV缓存和延迟分析。
本文提出了大规模AI推理中上下文表示的原理化方法,引入了R3Con,它优于基线方法,并使较小模型能够以更低成本达到与较大模型相当的性能。
文章报道了OpenRSI的Marin-Scaling-Ladder实验的初步结果,其中AI代理自主提出、实现和评估新的优化器,跨越从550M到2.5B的模型规模,发现了PSPR和Codex (GPT-5.6)。
Fuli Luo 分享了关于 MiMo-V2.6 模型在强化学习方面的扩展研究,重点关注计算规模、环境和工具链的提升。
本文研究了从2019年到2025年的AI预训练进展,发现在1e19 FLOPs预算下,数据改进对计算效率提升的贡献是模型改进的3.24倍。
本文研究了持久记忆AI代理如何过度信任过时的存储事实,导致模型能力所限制的故障,并评估了不同模型规模下的触发因素和缓解措施。
本文表明,扩展任务外模型生成的蒸馏数据可以放大学生的潜在教师特质,即使数据看似无害,这表明在AI训练中需要特质感知的筛选。
播客讨论涵盖了AI在物理模拟中的应用,包括扩展到万亿参数模型、高分辨率天气预报,以及聚变能源中等离子体行为的预测。
本文通过使用自然叙事研究语言模型和人类中的实体跟踪能力,发现子十亿参数的模型已达到人类水平并超越人类,表明核心语言理解能力在比先前假设更小的规模上涌现。
研究人员使用 DeepSeek V4 Flash 和 StateM 在 Terminal-Bench 2.1 上达到了 95.3% 的准确率,匹配了 GPT-5.6 Sol Max 的性能,并探索了超越模型扩展的智能体改进。
本文研究了在LLM预训练中重复高质量领域数据以在模型扩展时维持性能的权衡,发现最佳重复次数随模型大小增加,并与领域验证损失呈负相关。
本文介绍了Steerling-8B,一种以可解释性为约束训练的扩散语言模型,展示了可解释性随规模提升,并支持无需重新训练的概念引导。
李飞飞强调了一种新的用于机器人学习的测试时训练方法,该方法由Stanford SVL和NVIDIA Robotics合作开发,可将机器人模型上下文扩展到8000个时间步长,且推理成本恒定。
这是一条对一篇关于TPU/GPU集群中集体通信的博客文章的推文回复,建议进行后续工作,计算在Blackwell NVL72上对1T MoE模型的预期计算/通信时长,并估算理论MFU和瓶颈。
微信WeLM团队发表论文,介绍Hidden Decoding方法,在不增加Transformer主干参数的情况下通过隐藏流扩展计算,训练出WeLM-HD4-80B和WeLM-HD4-617B MoE模型,在多项基准上超越自回归基线。
本文审计了大模型作为裁判(LLM-as-judge)评估的可靠性,表明即使候选回复固定不变,更换评估模型也可能改变评分。论文考察了Qwen3和MiniMax模型的扩展与升级路径,得出结论:裁判升级不可互换,并提出了最佳报告实践。