scaling-laws

标签

Cards List
#scaling-laws

Pathway的BDH(后Transformer架构)在从零训练的10M到1B参数规模上匹配GPT-2的缩放规律,可在普通GPU上运行

Reddit r/LocalLLaMA · 19小时前

据报道,Pathway的BDH(一种后Transformer架构)在标准GPU上从零训练时,在10M到1B参数范围内匹配GPT-2的缩放性能。

0 人收藏 0 人点赞
#scaling-laws

@KimD0ing:征文启事:Scaling H2R @ CoRL 2026——人类数据已成为机器人学习最重要的数据。但随着其规模扩大,我们能期待什么?……

X AI KOLs Timeline · 昨天 缓存

CoRL 2026 上 Scaling H2R 研讨会的征文启事,聚焦于人类到机器人学习中的规模法则与多样性。提交截止日期:2026年10月7日。

0 人收藏 0 人点赞
#scaling-laws

目前理论上的 LLM 量化最佳位宽是什么?[D]

Reddit r/MachineLearning · 2天前

一个讨论性问题,询问在固定内存预算下 LLM 量化的理论最佳位宽,并引用了 2025-2026 年关于 3-bit/2-bit 结果和缩放定律的研究。

0 人收藏 0 人点赞
#scaling-laws

语言模型中的跨架构引导迁移:一项系统性实证研究

arXiv cs.CL · 3天前 缓存

一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。

0 人收藏 0 人点赞
#scaling-laws

人类认知与行为的小型基础模型

arXiv cs.AI · 3天前 缓存

本文研究在人类行为数据上微调的小型基础模型是否可以作为认知代理,发现规模在分布内影响甚微,但较大模型在分布外具有更好的泛化能力。

0 人收藏 0 人点赞
#scaling-laws

Skaling:Chinchilla的指数与Kaplan的耦合

Hugging Face Daily Papers · 3天前 缓存

本文介绍了Skaling定律,这是一种广义的神经缩放定律,通过一个交互指数将模型容量和数据耦合,将预测误差降低1.5至3倍,并能在计算量约为均匀扫描十分之一的情况下实现全网格外推。

0 人收藏 0 人点赞
#scaling-laws

扩展自回归Transformer以用于单细胞生成

arXiv cs.LG · 5天前 缓存

本文研究了一项自监督任务,即使用带有量化VAE分词器的自回归Transformer生成单细胞基因表达向量。文中报告了单细胞基础模型的缩放定律和计算最优前沿,并讨论了针对扰动预测进行微调的潜力。

0 人收藏 0 人点赞
#scaling-laws

从文本到视觉迁移了什么?VLM的能力缩放定律与迁移动态

arXiv cs.CL · 6天前 缓存

本文提出了一种能力驱动的多模态缩放定律,该定律可从LLM文本基准能力预测VLM性能,从而在不进行昂贵训练扫描的情况下,实现跨模型家族的原则性骨干选择。

0 人收藏 0 人点赞
#scaling-laws

LLaDA MoE v2:扩展混合专家扩散语言模型

Hugging Face Daily Papers · 6天前 缓存

一篇研究论文,提出了混合专家扩散语言模型的扩展定律和设计原则,并以 LLaDA MoE v2(30B-A3B)在 23.5T token 上进行训练,在多个基准测试上以更少的预训练 token 接近 Qwen3。

0 人收藏 0 人点赞
#scaling-laws

@turingbook: Harness(Agent)可能最大的价值,是到各行各业老法师的工作实际场景中,看他们怎么工作和思考的,记录和“蒸馏”他们的宝贵经验,这种数据原来可能都是隐性的。

X AI KOLs Timeline · 2026-08-02 缓存

The tweet highlights the potential of agent harnesses to capture and distill experts' tacit knowledge as new training data, referencing a Berkeley AI Summit talk by Jianfeng Gao on agentic modeling as an emerging AI paradigm.

0 人收藏 0 人点赞
#scaling-laws

训练前预测:粒子物理基础模型的缩放定律

arXiv cs.AI · 2026-07-31 缓存

本文证明,在小规模Transformer模型上拟合的缩放定律能够准确预测在粒子物理喷注数据上训练的更大模型的损失,从而在大规模训练之前将计算预算转化为预期的物理性能。他们发布了五个预训练模型以及完整的训练方案。

0 人收藏 0 人点赞
#scaling-laws

Chimera:混合视觉扩散Transformer的设计与Chinchilla式缩放

Hugging Face Daily Papers · 2026-07-30 缓存

本文介绍了Chimera,一种具有原则性缩放方案的混合视觉扩散骨干网络,结合了Kimi Delta Attention、多头潜在注意力和稀疏混合专家,以高效处理长上下文图像和视频生成。它还提出了HeteroP,一种模块级超参数迁移方案,以及Chinchilla式缩放定律,用于训练一个具有20亿激活参数的110亿参数模型。

0 人收藏 0 人点赞
#scaling-laws

大量AI算力即将上线,推动重大飞跃(赠阅文章)

Reddit r/artificial · 2026-07-29 缓存

NYT的一项分析详细介绍了全球前所未有的人工智能数据中心和芯片建设,预计到2028年人工智能算力将增长十倍,有望推动AI能力的重大突破。

0 人收藏 0 人点赞
#scaling-laws

cMoLLM 规模化:混合大语言模型的水平扩展定律

arXiv cs.AI · 2026-07-28 缓存

介绍了 cMoLLM,一种卷积门控混合大语言模型,通过完全可微的动态卷积在端到端流中进行路由,在匹配计算下提高了困惑度和下游任务准确率。

0 人收藏 0 人点赞
#scaling-laws

表格数据上经典机器学习的缩放定律:一项基准研究

arXiv cs.LG · 2026-07-27 缓存

本文对表格数据上经典机器学习模型的缩放定律进行了一项分布式基准研究,结果表明幂律拟合适用于大多数模型家族,并量化了127名学生运行中复制者实现的差异。

0 人收藏 0 人点赞
#scaling-laws

LLM的下一个重大‘扩展时代’是什么

Reddit r/singularity · 2026-07-24

作者回顾了过去LLM的扩展时代(模型规模、思维链、智能体),并推测下一个重大扩展维度,提出递归自我改进可能是一个突破。

0 人收藏 0 人点赞
#scaling-laws

从零开始的原生多模态预训练扩展

Hugging Face Daily Papers · 2026-07-24 缓存

本文研究了原生多模态预训练的扩展性质,推导了在固定预算下的计算最优模型大小和令牌数量,并揭示了语言和多模态目标的不同扩展行为。

0 人收藏 0 人点赞
#scaling-laws

@rohanpaul_ai: @NaceAI的新论文展示了一种可能的方法,可以在不重写语言模型核心参数的情况下添加大量知识…

X AI KOLs Following · 2026-07-23 缓存

来自NaceAI的一篇新论文提出了一种基于超网络的方法,用于在不修改核心参数的情况下向大型语言模型注入知识,可能实现高效的持续学习。该方法使用生成的低秩适配器来编码新事实,同时保持基础模型冻结。

0 人收藏 0 人点赞
#scaling-laws

可靠性反向缩放:更大模型通过隐藏的自回归风险机制更快积累错误

arXiv cs.LG · 2026-07-22 缓存

本文发现,更大的语言模型存在一种隐藏的自回归风险机制,在该机制下,模型会承诺低概率词元,进而导致错误滚雪球式增长,使得可靠性随规模扩大而更快下降。研究表明,这种故障模式是因果性的、主导性的,并且对模型自身的自我监控不可见。

0 人收藏 0 人点赞
#scaling-laws

基于超网络的大语言模型知识注入的缩放定律

Hugging Face Daily Papers · 2026-07-21 缓存

本文研究了基于超网络将知识注入大语言模型的缩放定律,发现了可预测的幂律缩放和可靠的分布外泛化,确立了超网络作为LoRA和全参数微调的可扩展替代方案。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈