model-scaling

标签

Cards List
#model-scaling

Nvidia Vera Rubin 是否真的能加速 LLM 预训练?接下来会是 10 万亿以上参数的模型吗?

Reddit r/ArtificialInteligence ↗ · 2天前

文章质疑 Nvidia 的 Vera Rubin 是否会加速 LLM 预训练,并探讨了考虑到数据、电力和成本等限制,超过 10 万亿参数的模型是否可行。

0 人收藏 0 人点赞
#model-scaling

突破 LLM 推理中同策略自蒸馏的规模扩展瓶颈

Hugging Face Daily Papers ↗ · 3天前 缓存

本文分析了用于 LLM 推理的同策略自蒸馏(OPSD),指出未经验证的学生生成骨架会带来模仿鸿沟,且该鸿沟随模型规模增大而加剧,因此提出了 OASIS 方法:利用模型生成的尝试作为教师上下文,主要对经过答案标签验证的同策略轨迹进行监督,使 Qwen3 1.7B/4B/8B 模型在 AIME/HMMT 基准上提升 3.2-3.8 个点。

0 人收藏 0 人点赞
#model-scaling

@vivekgalatage: 谈及推理时,《How to scale your model》一书中的专门章节不容错过。https:/…

X AI KOLs Timeline ↗ · 5天前 缓存

本文分享了《How to scale your model》一书中关于推理的专门章节,涵盖了Transformer模型的关键优化技术,如KV缓存和延迟分析。

0 人收藏 0 人点赞
#model-scaling

把握关键:大规模推理的原理化上下文表示

arXiv cs.CL ↗ · 2026-09-24 缓存

本文提出了大规模AI推理中上下文表示的原理化方法,引入了R3Con,它优于基线方法,并使较小模型能够以更低成本达到与较大模型相当的性能。

0 人收藏 0 人点赞
#model-scaling

@yuetai12575: 兴奋地看到随着模型扩展,收益进一步持续!

X AI KOLs Timeline ↗ · 2026-09-23 缓存

文章报道了OpenRSI的Marin-Scaling-Ladder实验的初步结果,其中AI代理自主提出、实现和评估新的优化器,跨越从550M到2.5B的模型规模,发现了PSPR和Codex (GPT-5.6)。

0 人收藏 0 人点赞
#model-scaling

@seclink: 罗老师真的牛,又有一个大创新,号召大厂都学习需学习...

X AI KOLs Following ↗ · 2026-09-17 缓存

Fuli Luo 分享了关于 MiMo-V2.6 模型在强化学习方面的扩展研究,重点关注计算规模、环境和工具链的提升。

0 人收藏 0 人点赞
#model-scaling

预训练进展主要来自数据(阅读需17分钟)

TLDR AI ↗ · 2026-09-09 缓存

本文研究了从2019年到2025年的AI预训练进展,发现在1e19 FLOPs预算下,数据改进对计算效率提升的贡献是模型改进的3.24倍。

0 人收藏 0 人点赞
#model-scaling

记忆信任差距:持久记忆代理中的能力相关故障

arXiv cs.AI ↗ · 2026-09-03 缓存

本文研究了持久记忆AI代理如何过度信任过时的存储事实,导致模型能力所限制的故障,并评估了不同模型规模下的触发因素和缓解措施。

0 人收藏 0 人点赞
#model-scaling

扩展模型生成的蒸馏数据可使潜在教师特质更易恢复

arXiv cs.LG ↗ · 2026-08-28 缓存

本文表明,扩展任务外模型生成的蒸馏数据可以放大学生的潜在教师特质,即使数据看似无害,这表明在AI训练中需要特质感知的筛选。

0 人收藏 0 人点赞
#model-scaling

@AnimaAnandkumar: 很高兴几周前能参加@latentspacepod播客,谈论用于物理模拟和理解的AI……

X AI KOLs Timeline ↗ · 2026-08-26 缓存

播客讨论涵盖了AI在物理模拟中的应用,包括扩展到万亿参数模型、高分辨率天气预报,以及聚变能源中等离子体行为的预测。

0 人收藏 0 人点赞
#model-scaling

在子十亿参数语言模型中,实体跟踪能力涌现,并在自然叙事中超越人类表现

arXiv cs.CL ↗ · 2026-08-20 缓存

本文通过使用自然叙事研究语言模型和人类中的实体跟踪能力,发现子十亿参数的模型已达到人类水平并超越人类,表明核心语言理解能力在比先前假设更小的规模上涌现。

0 人收藏 0 人点赞
#model-scaling

@VictorKaiWang1:在 Terminal Bench 2.1 上达到 95.3%,DeepSeek V4 Flash + StateM,在 TB2.1 上为 88.8%

X AI KOLs Timeline ↗ · 2026-08-18 缓存

研究人员使用 DeepSeek V4 Flash 和 StateM 在 Terminal-Bench 2.1 上达到了 95.3% 的准确率,匹配了 GPT-5.6 Sol Max 的性能,并探索了超越模型扩展的智能体改进。

0 人收藏 0 人点赞
#model-scaling

LLM预训练中的领域数据重复扩展研究

Hugging Face Daily Papers ↗ · 2026-08-14

本文研究了在LLM预训练中重复高质量领域数据以在模型扩展时维持性能的权衡,发现最佳重复次数随模型大小增加,并与领域验证损失呈负相关。

0 人收藏 0 人点赞
#model-scaling

扩展固有可解释语言模型

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

本文介绍了Steerling-8B,一种以可解释性为约束训练的扩散语言模型,展示了可解释性随规模提升,并支持无需重新训练的概念引导。

0 人收藏 0 人点赞
#model-scaling

@drfeifei: 我对这项用于机器人学习的测试时训练工作感到非常兴奋!这是与@StanfordS…的精彩合作

X AI KOLs Following ↗ · 2026-07-15 缓存

李飞飞强调了一种新的用于机器人学习的测试时训练方法,该方法由Stanford SVL和NVIDIA Robotics合作开发,可将机器人模型上下文扩展到8000个时间步长,且推理成本恒定。

0 人收藏 0 人点赞
#model-scaling

@nrehiew_: 这太棒了!一个有趣的后续是,给定任意拓扑和架构,计算预期的计算/…

X AI KOLs Timeline ↗ · 2026-07-15 缓存

这是一条对一篇关于TPU/GPU集群中集体通信的博客文章的推文回复,建议进行后续工作,计算在Blackwell NVL72上对1T MoE模型的预期计算/通信时长,并估算理论MFU和瓶颈。

0 人收藏 0 人点赞
#model-scaling

@Fenng: 微信 WeLM 团队的这篇论文至少透露了两种模型规模:80B 和 617B。每种规模分别包含普通版与 HD4 版,即 WeLM-80B、WeLM-HD4-80B、WeLM-617B 和 WeLM-HD4-617B。 其中,WeLM-617…

X AI KOLs Timeline ↗ · 2026-07-12 缓存

微信WeLM团队发表论文,介绍Hidden Decoding方法,在不增加Transformer主干参数的情况下通过隐藏流扩展计算,训练出WeLM-HD4-80B和WeLM-HD4-617B MoE模型,在多项基准上超越自回归基线。

0 人收藏 0 人点赞
#model-scaling

换一个裁判,分数就变了:审计大模型作为裁判的可靠性

arXiv cs.CL ↗ · 2026-07-10 缓存

本文审计了大模型作为裁判(LLM-as-judge)评估的可靠性,表明即使候选回复固定不变,更换评估模型也可能改变评分。论文考察了Qwen3和MiniMax模型的扩展与升级路径,得出结论:裁判升级不可互换,并提出了最佳报告实践。

0 人收藏 0 人点赞
#model-scaling

扩展定律,谨慎解读(25分钟阅读)

TLDR AI ↗ · 2026-06-26 缓存

全面概述深度学习中的扩展定律,追溯其理论基础和实证发现,并解释损失如何随模型大小、数据和计算量可预测地降低。

0 人收藏 0 人点赞
#model-scaling

2023-2031年模型规模扩展(阅读时间21分钟)

TLDR AI ↗ · 2026-06-23 缓存

一篇关于AI模型规模扩展趋势的分析,发布于LessWrong,时间跨度为2023年至2031年。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈