model-scaling

标签

Cards List
#model-scaling

# 超大号智能 (Extra Big-Ass Intelligence)

Hacker News Top ↗ · 14小时前

# 「超大杯」AI 智能:从 XL 到 XXL 的模型身材焦虑 ## 引言:谁把我的参数越写越大? 还记得当年用 5 亿参数的模型跑一个情感分析,就已经觉得「哇,好聪明」。如今你要是拿它出来,大家只会礼貌地问一句:**「这是去年的吗?」** 语言模型的进化速度,比你的手机换代速度还快——只不过,别人家的升级是性能翻倍,我们的是**腰围翻倍**。 ## 一、参数军备竞赛:一场没有终点的赛跑 GPT 系列从 1.7B 到千亿级别,不过用了短短几年。各家实验室的对话大概是这样的: - **研究员 A**:「我们的模型有 70 亿参数。」 - **研究员 B**:「我们的有 700 亿。」 - **研究员 C**:「我们的有……你先别听,我们先说显存够不够。」 参数规模已经成了某种科技圈的腰围——**没人想承认自己比别人小**。于是我们看到一个诡异的现象:明明任务只有 300 词的摘要,却要用上一台足以驱动小型城市的 GPU 集群。 ## 二、「越大越聪明」的神话与真相 是的,模型大了确实更聪明,但这里的「聪明」有几个前提: 1. **数据质量得跟上**——用互联网垃圾喂出来的百亿参数模型,可能只是一个博览众「坑」的博学白痴。 2. **推理成本得算清**——调用一次的电费,可能比你自己动手写完那份报告还贵。 3. **并非线性收益**——从 7B 到 70B 提升明显,从 70B 到 700B……嗯,钱包先哭了。 换句话说,**模型大小和智能水平的关系,更像房价和幸福感的关系**:有帮助,但远没有你以为的那么有帮助。 ## 三、当「Extra Large」成为默认选项 行业现在的默认设定是:**能训多大就训多大**。这背后有真金白银的逻辑——推理服务、论文引用、融资估值,都对「参数量」这个数字格外敏感。 但普通用户关心的是什么?是它能不能: - 用你说人话的方式回答问题; - 在 3 秒内给你结果,而不是让你等到泡面凉了; - 跑在你那台笔记本上,而不是云端的某个数据中心。 于是「大模型」和「好用的模型」之间,出现了一条微妙的裂缝。这条裂缝里,藏着蒸馏、量化、剪枝这些把大象塞进冰箱的艺术。 ## 四、小模型的反击:秀肌肉不如秀性价比 当大家都在比谁的模型「更胖」时,一批精瘦选手开始逆袭: - **7B 级别的模型**,经过高质量数据微调后,可以在特定任务上吊打通用巨型模型; - **MoE(混合专家)架构**,让模型外表臃肿、实际只动用一小部分参数干活——**AI 界的「看起来很壮」**; - **端侧部署**让手机、笔记本也能跑起不错的模型,用户终于不用为一句「今天天气怎么样」排队等待 GPU 了。 事实证明,**智能不是体积的函数,而是数据、架构和训练策略的函数**。 ## 五、展望:我们到底在追求什么? 这场「越做越大」的竞赛,最终指向的应该是**更聪明的智能**,而不是更占地方的参数。好消息是,行业已经开始出现清醒的声音:评估标准正在从「参数量」转向「能力表现」,从「谁训得最大」转向「谁用得最好」。 也许未来的某一天,我们会对一个模型说:**「你不需要长那么高,把问题回答好就行。」** 而这,可能才是真正意义上的——**Extra Large Intelligence**。 --- *写完这篇稿子,我的笔记本风扇已经开始抗议了。模型的身材焦虑,原来会传染。*

0 人收藏 0 人点赞
#model-scaling

Nvidia Vera Rubin 是否真的能加速 LLM 预训练?接下来会是 10 万亿以上参数的模型吗?

Reddit r/ArtificialInteligence ↗ · 4天前

文章质疑 Nvidia 的 Vera Rubin 是否会加速 LLM 预训练,并探讨了考虑到数据、电力和成本等限制,超过 10 万亿参数的模型是否可行。

0 人收藏 0 人点赞
#model-scaling

突破 LLM 推理中同策略自蒸馏的规模扩展瓶颈

Hugging Face Daily Papers ↗ · 4天前 缓存

本文分析了用于 LLM 推理的同策略自蒸馏(OPSD),指出未经验证的学生生成骨架会带来模仿鸿沟,且该鸿沟随模型规模增大而加剧,因此提出了 OASIS 方法:利用模型生成的尝试作为教师上下文,主要对经过答案标签验证的同策略轨迹进行监督,使 Qwen3 1.7B/4B/8B 模型在 AIME/HMMT 基准上提升 3.2-3.8 个点。

0 人收藏 0 人点赞
#model-scaling

@vivekgalatage: 谈及推理时,《How to scale your model》一书中的专门章节不容错过。https:/…

X AI KOLs Timeline ↗ · 6天前 缓存

本文分享了《How to scale your model》一书中关于推理的专门章节,涵盖了Transformer模型的关键优化技术,如KV缓存和延迟分析。

0 人收藏 0 人点赞
#model-scaling

把握关键:大规模推理的原理化上下文表示

arXiv cs.CL ↗ · 2026-09-24 缓存

本文提出了大规模AI推理中上下文表示的原理化方法,引入了R3Con,它优于基线方法,并使较小模型能够以更低成本达到与较大模型相当的性能。

0 人收藏 0 人点赞
#model-scaling

@yuetai12575: 兴奋地看到随着模型扩展,收益进一步持续!

X AI KOLs Timeline ↗ · 2026-09-23 缓存

文章报道了OpenRSI的Marin-Scaling-Ladder实验的初步结果,其中AI代理自主提出、实现和评估新的优化器,跨越从550M到2.5B的模型规模,发现了PSPR和Codex (GPT-5.6)。

0 人收藏 0 人点赞
#model-scaling

@seclink: 罗老师真的牛,又有一个大创新,号召大厂都学习需学习...

X AI KOLs Following ↗ · 2026-09-17 缓存

Fuli Luo 分享了关于 MiMo-V2.6 模型在强化学习方面的扩展研究,重点关注计算规模、环境和工具链的提升。

0 人收藏 0 人点赞
#model-scaling

预训练进展主要来自数据(阅读需17分钟)

TLDR AI ↗ · 2026-09-09 缓存

本文研究了从2019年到2025年的AI预训练进展,发现在1e19 FLOPs预算下,数据改进对计算效率提升的贡献是模型改进的3.24倍。

0 人收藏 0 人点赞
#model-scaling

记忆信任差距:持久记忆代理中的能力相关故障

arXiv cs.AI ↗ · 2026-09-03 缓存

本文研究了持久记忆AI代理如何过度信任过时的存储事实,导致模型能力所限制的故障,并评估了不同模型规模下的触发因素和缓解措施。

0 人收藏 0 人点赞
#model-scaling

扩展模型生成的蒸馏数据可使潜在教师特质更易恢复

arXiv cs.LG ↗ · 2026-08-28 缓存

本文表明,扩展任务外模型生成的蒸馏数据可以放大学生的潜在教师特质,即使数据看似无害,这表明在AI训练中需要特质感知的筛选。

0 人收藏 0 人点赞
#model-scaling

@AnimaAnandkumar: 很高兴几周前能参加@latentspacepod播客,谈论用于物理模拟和理解的AI……

X AI KOLs Timeline ↗ · 2026-08-26 缓存

播客讨论涵盖了AI在物理模拟中的应用,包括扩展到万亿参数模型、高分辨率天气预报,以及聚变能源中等离子体行为的预测。

0 人收藏 0 人点赞
#model-scaling

在子十亿参数语言模型中,实体跟踪能力涌现,并在自然叙事中超越人类表现

arXiv cs.CL ↗ · 2026-08-20 缓存

本文通过使用自然叙事研究语言模型和人类中的实体跟踪能力,发现子十亿参数的模型已达到人类水平并超越人类,表明核心语言理解能力在比先前假设更小的规模上涌现。

0 人收藏 0 人点赞
#model-scaling

@VictorKaiWang1:在 Terminal Bench 2.1 上达到 95.3%,DeepSeek V4 Flash + StateM,在 TB2.1 上为 88.8%

X AI KOLs Timeline ↗ · 2026-08-18 缓存

研究人员使用 DeepSeek V4 Flash 和 StateM 在 Terminal-Bench 2.1 上达到了 95.3% 的准确率,匹配了 GPT-5.6 Sol Max 的性能,并探索了超越模型扩展的智能体改进。

0 人收藏 0 人点赞
#model-scaling

LLM预训练中的领域数据重复扩展研究

Hugging Face Daily Papers ↗ · 2026-08-14

本文研究了在LLM预训练中重复高质量领域数据以在模型扩展时维持性能的权衡,发现最佳重复次数随模型大小增加,并与领域验证损失呈负相关。

0 人收藏 0 人点赞
#model-scaling

扩展固有可解释语言模型

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

本文介绍了Steerling-8B,一种以可解释性为约束训练的扩散语言模型,展示了可解释性随规模提升,并支持无需重新训练的概念引导。

0 人收藏 0 人点赞
#model-scaling

@drfeifei: 我对这项用于机器人学习的测试时训练工作感到非常兴奋!这是与@StanfordS…的精彩合作

X AI KOLs Following ↗ · 2026-07-15 缓存

李飞飞强调了一种新的用于机器人学习的测试时训练方法,该方法由Stanford SVL和NVIDIA Robotics合作开发,可将机器人模型上下文扩展到8000个时间步长,且推理成本恒定。

0 人收藏 0 人点赞
#model-scaling

@nrehiew_: 这太棒了!一个有趣的后续是,给定任意拓扑和架构,计算预期的计算/…

X AI KOLs Timeline ↗ · 2026-07-15 缓存

这是一条对一篇关于TPU/GPU集群中集体通信的博客文章的推文回复,建议进行后续工作,计算在Blackwell NVL72上对1T MoE模型的预期计算/通信时长,并估算理论MFU和瓶颈。

0 人收藏 0 人点赞
#model-scaling

@Fenng: 微信 WeLM 团队的这篇论文至少透露了两种模型规模:80B 和 617B。每种规模分别包含普通版与 HD4 版,即 WeLM-80B、WeLM-HD4-80B、WeLM-617B 和 WeLM-HD4-617B。 其中,WeLM-617…

X AI KOLs Timeline ↗ · 2026-07-12 缓存

微信WeLM团队发表论文,介绍Hidden Decoding方法,在不增加Transformer主干参数的情况下通过隐藏流扩展计算,训练出WeLM-HD4-80B和WeLM-HD4-617B MoE模型,在多项基准上超越自回归基线。

0 人收藏 0 人点赞
#model-scaling

换一个裁判,分数就变了:审计大模型作为裁判的可靠性

arXiv cs.CL ↗ · 2026-07-10 缓存

本文审计了大模型作为裁判(LLM-as-judge)评估的可靠性,表明即使候选回复固定不变,更换评估模型也可能改变评分。论文考察了Qwen3和MiniMax模型的扩展与升级路径,得出结论:裁判升级不可互换,并提出了最佳报告实践。

0 人收藏 0 人点赞
#model-scaling

扩展定律,谨慎解读(25分钟阅读)

TLDR AI ↗ · 2026-06-26 缓存

全面概述深度学习中的扩展定律,追溯其理论基础和实证发现,并解释损失如何随模型大小、数据和计算量可预测地降低。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈