scaling-laws

标签

Cards List
#scaling-laws

目前理论上的 LLM 量化最佳位宽是什么?[D]

Reddit r/MachineLearning · 昨天

一个讨论性问题,询问在固定内存预算下 LLM 量化的理论最佳位宽,并引用了 2025-2026 年关于 3-bit/2-bit 结果和缩放定律的研究。

0 人收藏 0 人点赞
#scaling-laws

语言模型中的跨架构引导迁移:一项系统性实证研究

arXiv cs.CL · 2天前 缓存

一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。

0 人收藏 0 人点赞
#scaling-laws

人类认知与行为的小型基础模型

arXiv cs.AI · 2天前 缓存

本文研究在人类行为数据上微调的小型基础模型是否可以作为认知代理,发现规模在分布内影响甚微,但较大模型在分布外具有更好的泛化能力。

0 人收藏 0 人点赞
#scaling-laws

扩展自回归Transformer以用于单细胞生成

arXiv cs.LG · 4天前 缓存

本文研究了一项自监督任务,即使用带有量化VAE分词器的自回归Transformer生成单细胞基因表达向量。文中报告了单细胞基础模型的缩放定律和计算最优前沿,并讨论了针对扰动预测进行微调的潜力。

0 人收藏 0 人点赞
#scaling-laws

从文本到视觉迁移了什么?VLM的能力缩放定律与迁移动态

arXiv cs.CL · 5天前 缓存

本文提出了一种能力驱动的多模态缩放定律,该定律可从LLM文本基准能力预测VLM性能,从而在不进行昂贵训练扫描的情况下,实现跨模型家族的原则性骨干选择。

0 人收藏 0 人点赞
#scaling-laws

LLaDA MoE v2:扩展混合专家扩散语言模型

Hugging Face Daily Papers · 5天前 缓存

一篇研究论文,提出了混合专家扩散语言模型的扩展定律和设计原则,并以 LLaDA MoE v2(30B-A3B)在 23.5T token 上进行训练,在多个基准测试上以更少的预训练 token 接近 Qwen3。

0 人收藏 0 人点赞
#scaling-laws

@turingbook: Harness(Agent)可能最大的价值,是到各行各业老法师的工作实际场景中,看他们怎么工作和思考的,记录和“蒸馏”他们的宝贵经验,这种数据原来可能都是隐性的。

X AI KOLs Timeline · 6天前 缓存

The tweet highlights the potential of agent harnesses to capture and distill experts' tacit knowledge as new training data, referencing a Berkeley AI Summit talk by Jianfeng Gao on agentic modeling as an emerging AI paradigm.

0 人收藏 0 人点赞
#scaling-laws

训练前预测:粒子物理基础模型的缩放定律

arXiv cs.AI · 2026-07-31 缓存

本文证明,在小规模Transformer模型上拟合的缩放定律能够准确预测在粒子物理喷注数据上训练的更大模型的损失,从而在大规模训练之前将计算预算转化为预期的物理性能。他们发布了五个预训练模型以及完整的训练方案。

0 人收藏 0 人点赞
#scaling-laws

Chimera:混合视觉扩散Transformer的设计与Chinchilla式缩放

Hugging Face Daily Papers · 2026-07-30 缓存

本文介绍了Chimera,一种具有原则性缩放方案的混合视觉扩散骨干网络,结合了Kimi Delta Attention、多头潜在注意力和稀疏混合专家,以高效处理长上下文图像和视频生成。它还提出了HeteroP,一种模块级超参数迁移方案,以及Chinchilla式缩放定律,用于训练一个具有20亿激活参数的110亿参数模型。

0 人收藏 0 人点赞
#scaling-laws

大量AI算力即将上线,推动重大飞跃(赠阅文章)

Reddit r/artificial · 2026-07-29 缓存

NYT的一项分析详细介绍了全球前所未有的人工智能数据中心和芯片建设,预计到2028年人工智能算力将增长十倍,有望推动AI能力的重大突破。

0 人收藏 0 人点赞
#scaling-laws

cMoLLM 规模化:混合大语言模型的水平扩展定律

arXiv cs.AI · 2026-07-28 缓存

介绍了 cMoLLM,一种卷积门控混合大语言模型,通过完全可微的动态卷积在端到端流中进行路由,在匹配计算下提高了困惑度和下游任务准确率。

0 人收藏 0 人点赞
#scaling-laws

表格数据上经典机器学习的缩放定律:一项基准研究

arXiv cs.LG · 2026-07-27 缓存

本文对表格数据上经典机器学习模型的缩放定律进行了一项分布式基准研究,结果表明幂律拟合适用于大多数模型家族,并量化了127名学生运行中复制者实现的差异。

0 人收藏 0 人点赞
#scaling-laws

LLM的下一个重大‘扩展时代’是什么

Reddit r/singularity · 2026-07-24

作者回顾了过去LLM的扩展时代(模型规模、思维链、智能体),并推测下一个重大扩展维度,提出递归自我改进可能是一个突破。

0 人收藏 0 人点赞
#scaling-laws

从零开始的原生多模态预训练扩展

Hugging Face Daily Papers · 2026-07-24 缓存

本文研究了原生多模态预训练的扩展性质,推导了在固定预算下的计算最优模型大小和令牌数量,并揭示了语言和多模态目标的不同扩展行为。

0 人收藏 0 人点赞
#scaling-laws

@rohanpaul_ai: @NaceAI的新论文展示了一种可能的方法,可以在不重写语言模型核心参数的情况下添加大量知识…

X AI KOLs Following · 2026-07-23 缓存

来自NaceAI的一篇新论文提出了一种基于超网络的方法,用于在不修改核心参数的情况下向大型语言模型注入知识,可能实现高效的持续学习。该方法使用生成的低秩适配器来编码新事实,同时保持基础模型冻结。

0 人收藏 0 人点赞
#scaling-laws

可靠性反向缩放:更大模型通过隐藏的自回归风险机制更快积累错误

arXiv cs.LG · 2026-07-22 缓存

本文发现,更大的语言模型存在一种隐藏的自回归风险机制,在该机制下,模型会承诺低概率词元,进而导致错误滚雪球式增长,使得可靠性随规模扩大而更快下降。研究表明,这种故障模式是因果性的、主导性的,并且对模型自身的自我监控不可见。

0 人收藏 0 人点赞
#scaling-laws

基于超网络的大语言模型知识注入的缩放定律

Hugging Face Daily Papers · 2026-07-21 缓存

本文研究了基于超网络将知识注入大语言模型的缩放定律,发现了可预测的幂律缩放和可靠的分布外泛化,确立了超网络作为LoRA和全参数微调的可扩展替代方案。

0 人收藏 0 人点赞
#scaling-laws

从预训练到后训练的推理理解

arXiv cs.CL · 2026-07-20 缓存

本文以国际象棋作为受控测试平台,研究了预训练与强化学习(RL)后训练之间的关系。它建立了连接预训练损失与后RL性能的缩放定律,并表明RL在简单谜题上放大了正确的走法,同时在困难谜题上浮现出新的正确走法。

0 人收藏 0 人点赞
#scaling-laws

观点:量子程序生成必须优先考虑有效性而非概率性扩展

arXiv cs.LG · 2026-07-20 缓存

这篇观点文章认为,由于严格的数学约束,生成模型的概率性扩展不足以用于量子电路生成,并提出了集成形式化方法的验证感知架构。

0 人收藏 0 人点赞
#scaling-laws

@kimiahmdh: 我们能否判断数据域在预训练期间是合作还是竞争?加入代码使模型在……方面表现更好

X AI KOLs Timeline · 2026-07-16 缓存

这项研究探讨了不同数据域在预训练期间的互动方式,发现加入代码可以提高数学性能,而某些组合则会相互影响,并提出将数据协同纳入缩放定律。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈