model-scaling

标签

Cards List
#model-scaling

LLM预训练中的领域数据重复扩展研究

Hugging Face Daily Papers · 3天前

本文研究了在LLM预训练中重复高质量领域数据以在模型扩展时维持性能的权衡,发现最佳重复次数随模型大小增加,并与领域验证损失呈负相关。

0 人收藏 0 人点赞
#model-scaling

扩展固有可解释语言模型

Hugging Face Daily Papers · 2026-08-06 缓存

本文介绍了Steerling-8B,一种以可解释性为约束训练的扩散语言模型,展示了可解释性随规模提升,并支持无需重新训练的概念引导。

0 人收藏 0 人点赞
#model-scaling

@drfeifei: 我对这项用于机器人学习的测试时训练工作感到非常兴奋!这是与@StanfordS…的精彩合作

X AI KOLs Following · 2026-07-15 缓存

李飞飞强调了一种新的用于机器人学习的测试时训练方法,该方法由Stanford SVL和NVIDIA Robotics合作开发,可将机器人模型上下文扩展到8000个时间步长,且推理成本恒定。

0 人收藏 0 人点赞
#model-scaling

@nrehiew_: 这太棒了!一个有趣的后续是,给定任意拓扑和架构,计算预期的计算/…

X AI KOLs Timeline · 2026-07-15 缓存

这是一条对一篇关于TPU/GPU集群中集体通信的博客文章的推文回复,建议进行后续工作,计算在Blackwell NVL72上对1T MoE模型的预期计算/通信时长,并估算理论MFU和瓶颈。

0 人收藏 0 人点赞
#model-scaling

@Fenng: 微信 WeLM 团队的这篇论文至少透露了两种模型规模:80B 和 617B。每种规模分别包含普通版与 HD4 版,即 WeLM-80B、WeLM-HD4-80B、WeLM-617B 和 WeLM-HD4-617B。 其中,WeLM-617…

X AI KOLs Timeline · 2026-07-12 缓存

微信WeLM团队发表论文,介绍Hidden Decoding方法,在不增加Transformer主干参数的情况下通过隐藏流扩展计算,训练出WeLM-HD4-80B和WeLM-HD4-617B MoE模型,在多项基准上超越自回归基线。

0 人收藏 0 人点赞
#model-scaling

换一个裁判,分数就变了:审计大模型作为裁判的可靠性

arXiv cs.CL · 2026-07-10 缓存

本文审计了大模型作为裁判(LLM-as-judge)评估的可靠性,表明即使候选回复固定不变,更换评估模型也可能改变评分。论文考察了Qwen3和MiniMax模型的扩展与升级路径,得出结论:裁判升级不可互换,并提出了最佳报告实践。

0 人收藏 0 人点赞
#model-scaling

扩展定律,谨慎解读(25分钟阅读)

TLDR AI · 2026-06-26 缓存

全面概述深度学习中的扩展定律,追溯其理论基础和实证发现,并解释损失如何随模型大小、数据和计算量可预测地降低。

0 人收藏 0 人点赞
#model-scaling

2023-2031年模型规模扩展(阅读时间21分钟)

TLDR AI · 2026-06-23 缓存

一篇关于AI模型规模扩展趋势的分析,发布于LessWrong,时间跨度为2023年至2031年。

0 人收藏 0 人点赞
#model-scaling

BitNet是个死胡同吗?三进制大语言模型发生了什么?

Reddit r/LocalLLaMA · 2026-06-08

文章质疑为何像BitNet这样的三进制语言模型在初期显示出潜力后,却未能扩展到超过2B参数,并讨论了开放权重AI实验室明显缺乏进展的情况。

0 人收藏 0 人点赞
#model-scaling

@ChrisGPotts:我们理所当然地认为更大的模型比小的更好,但为什么会这样?我们的新论文,由Jing Hua领导……

X AI KOLs Following · 2026-06-01 缓存

本文探讨了为什么更大的模型性能优于较小的模型,通过形式化分析和实验将其归因于数据引发的神经资源竞争。

0 人收藏 0 人点赞
#model-scaling

为什么更大的模型能学到更多:容量、干扰与罕见任务保留的影响

Hugging Face Daily Papers · 2026-05-28 缓存

本文研究了为什么更大的模型表现优于较小的模型,将其归因于梯度干扰减少和资源分配优化,这使得它们即使在无限数据下也能学习罕见且复杂的任务。在合成数据和OLMo模型上的实验验证了,更大的模型由于对常见任务的梯度更新较弱,能够避免覆盖罕见任务的特征。

0 人收藏 0 人点赞
#model-scaling

统一神经缩放定律

Hugging Face Daily Papers · 2026-05-25 缓存

提出了一种统一神经缩放定律,能够精确建模深度神经网络在多个维度(包括参数量、数据集大小、训练步数和计算量)上的缩放行为,并在多种架构和任务上得到验证。

0 人收藏 0 人点赞
#model-scaling

GQA-{\mu}P: 群组查询注意力的最大参数化更新

arXiv cs.LG · 2026-05-18 缓存

本文将最大更新参数化(μP)框架扩展到群组查询注意力(GQA),推导出跨模型架构的超参数迁移的缩放定律。它引入了用于特征学习的谱范数条件,并解决了GQA中低秩权重矩阵的问题。

0 人收藏 0 人点赞
#model-scaling

MoE模型中活跃参数数量是否有上限?

Reddit r/LocalLLaMA · 2026-05-14

关于混合专家(MoE)模型中活跃参数数量限制的讨论,质疑是否存在一个活跃参数数量的上限,超过该上限后质量不再提升。

0 人收藏 0 人点赞
#model-scaling

Olmo Hybrid:从理论到实践再回到理论

arXiv cs.CL · 2026-04-20 缓存

本论文介绍了Olmo Hybrid,一个包含70亿参数的语言模型,结合了注意力机制和Gated DeltaNet递归层,相比纯Transformer架构展现出理论和实证优势。该工作表明混合模型具有更强的表达能力,在预训练中扩展效率更高,且性能优于可比的Transformer基线。

0 人收藏 0 人点赞
#model-scaling

基于不同微调策略和模型规模的LLM归因分析在自动代码合规性检查中的应用

arXiv cs.CL · 2026-04-20 缓存

本文使用基于扰动的归因分析方法,分析了不同微调策略(全量微调、LoRA、量化LoRA)和模型规模对LLM在自动代码合规性任务中解释行为的影响。研究发现全量微调产生的归因模式比参数高效方法更集中,而较大的模型会形成特定的解释策略,但性能收益在超过7B参数后出现递减。

0 人收藏 0 人点赞
#model-scaling

模型能力主导:AIMO 3推理时优化的经验启示

Hugging Face Daily Papers · 2026-04-16 缓存

本论文分析了AIMO 3的推理时优化技术,发现模型能力优于提示工程和多样化采样策略。研究表明高温度采样已经能够最大程度地去相关化误差,为基于提示的改进留下了很少余地,并识别出单个模型pass@20与多数投票共识之间存在6分的选择损失差距。

0 人收藏 0 人点赞
#model-scaling

简化、稳定和扩展连续时间一致性模型

OpenAI Blog · 2024-10-23 缓存

OpenAI 推出 sCM(简化连续时间一致性模型),这是一种新方法,可将一致性模型扩展至 1.5B 参数,通过仅 2 个采样步骤生成高质量样本,相比扩散模型实现约 50 倍的加速。该方法展示了与最先进扩散模型相当的样本质量,同时有效采样计算量不足 10%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈