标签
本文提出了一种用户表示学习的稠密化定律,量化了数据规模与分词容量之间的关系,并引入了一种自适应分词方法ALGN,以提高十亿级场景的效率。
该推文讨论了模拟作为AI中潜在的新扩展规律,强调了来自Simile AI首席执行官的采访洞见,关于模拟人类行为以进行高级AI研究。
Lightwheel AI 和 Hugging Face 已开源 EgoSuite-Open100K,这是目前最大的全标注第一人称视角人类行为数据集,包含 100,000 小时的数据,重点强调物理AI的规模定律。
Chart Pathway的BDH-CQ,一个150M参数的推理模型,在ARC-AGI-1上达到了29.5%的准确率,每任务成本远低于像GPT-5.6 Luna这样的大型模型,展示了成本-精度权衡的改进。
推荐斯坦福大学CS329A课程,关于自我改进的AI智能体,涵盖scaling law、思维链、RLHF、推理模型等内容。
作者在Berkeley AI Summit 2026总结了Jianfeng Gao教授的演讲,指出AI建模的新范式是基于Agentic Modeling和新数据飞轮,强调Harness将成为应用护城河的关键。
本文提出一个标度律,表明人类语言中词序的上下文影响随距离近似以1/d的速率衰减,该衰减通过大型语言模型测得的困惑度降低来衡量,且在不同语言和语料库中均成立。
DomainPilot 提出了一种基于领域级损失引导的两阶段框架,用于大语言模型微调中的数据混合优化,在无需增加数据量或训练成本的情况下,在 MMLU-Redux、AIME24、LiveCodeBench v5 和 BFCL v3 上实现了性能提升。
研究人员研究了强化学习(RL)与预训练质量之间的相互作用,表明预训练更强的模型从RL中获益更多,且RL无法完全弥补弱预训练的不足。还确定了预训练和后训练计算分配的联合缩放定律。
本文研究了波兰 Bielik 大语言模型中的激活模式是否能在生成前检测到实体熟悉度,使用了无监督的分散度量,在模型规模上实现了已知实体与虚构实体的近乎完美分离,同时表明事实可靠性随规模急剧提升,但更难从激活中预测。
字节Seed团队发布了EdgeBench基准测试,允许AI模型连续工作12-72小时来评估长程任务中的学习能力,发现模型从环境学习的时间和性能之间遵循log-sigmoid曲线,存在新的Scaling Law。
本文认为,包括GPT-5在内的数据驱动机器学习系统无法仅通过缩放达到符号级别的逻辑推理,原因在于它们在区分逻辑结构与统计规律方面存在固有局限性。
Sakana AI 发布 Fugu,一个仅 0.6B 参数的多智能体编排系统,通过智能任务拆分和模型协作达到前沿性能,绕开了传统的参数量扩增路径,标志着多智能体编排正式成为可用的生产力工具。
这是一条对晚点LateTask访谈的总结,回顾了百度美研在AI领域的早期布局,包括投资Cerebras、差点投资OpenAI和Anthropic,以及多位人才从百度流向这些公司等历史细节。
文章回顾了百度美研十年前投资Cerebras晶圆级芯片公司的故事,分析了AI芯片市场从训练到推理的转变,以及非共识投资的重要性。
本文证明权重范数因果性地控制神经网络中grokking的时间尺度,调和了相互矛盾的论述。通过干预实验,它表明grokking遵循指数延迟定律,且范数大小在不同架构中比学习率更主导grokking时间。
Channel AI创始人Luke Orthwine提出一种新的软件开发方法论:将编程思维从传统的象棋式单线程线性思考,转向实时战略游戏(RTS)式的高并发、宏观调度和饱和攻击,以实现AI Agent时代的高效率开发。
这篇文章探讨了物理学与深度学习之间的深层联系,分析了Scaling Law、涌现等现象与物理学中临界标度律、相变等概念的同构性,并梳理了物理方法论在AI中的应用现状与前景。
StreamMA 提出了一种用于多智能体推理的流式通信范式,通过管道化中间结果来降低延迟,并利用更可靠的早期步骤提升效果,在多个基准测试中优于基线方法,同时揭示了步骤级别的缩放定律。