标签
本文提出一种结构化的阶梯框架,用于将大型推理模型扩展到超越人类监督的范畴,重点解决自主奖励和自生成经验方面的挑战,并指出相关风险和评估维度。
本文介绍了World Model RL,通过用学习到的世界模型替代环境执行来扩展自动研究代理,从而将后训练加速3-4倍,并使较小的代理在基准测试中优于较大的代理。
Clay 将智能体评估规模提升至每月3亿次以上,介绍了其四象限评估框架以及在生产与评估闭环中面临的挑战。
作者反思了管理多个AI代理在扩展时的挑战,将其与微服务中的基础设施问题进行比较,并提到了像Lyzr这样的集中管理工具。
本文提出了一个基于采样算法(如Sequential Monte Carlo和Replica Exchange)引导和扩展大型语言模型的理论框架,旨在无需外部监督即可提升生成质量。
Namespace Labs正在大规模拆箱MacBook,将其用作服务器机架,建议创业公司考虑使用MacBook搭建服务器农场。
本文将 Muon 优化器应用于扩散变换器,参数规模从 13 亿扩展到 150 亿,并引入周期性行式 Muon 以减少计算开销,同时保持相对于 AdamW 的生成质量提升。
Apodex 1.1通过扩展可执行环境并训练智能代理进行长期协调,改善了在复杂现实任务中的持续、可验证进展,以更小的350亿参数模型实现了领先性能。
Percy Liang 分享了 Harrier K40 训练运行的数据组成概览,详细说明了作为 Marin 团队共同努力一部分的域集群和质量桶。
Marin 535B-A23B AI模型的训练已开始,过程开放,涉及在GB200 NVL72硬件上使用18.75万亿tokens进行预训练和中训练,历时约3个月。
文章推测了将全球用于数百万AI提示的计算资源集中到一个单一科学问题上,如治愈癌症的潜在影响,并质疑这是否能带来更深层次的科学智能。
这篇文章详细介绍了在百万小时规模上训练Dyna-2 AI模型的基础设施和挑战,重点关注数据生命周期和GPU集群优化。
一篇关于使用 vLLM 高效服务 AI 代理 LLM 推理的教程,涵盖了连续批处理和 PagedAttention 等概念,以解决性能瓶颈。
本文回顾了从BERT到高级智能体系统的语言模型八年的演变,记录了能力-成本曲线的崩塌以及任务专用模型的出现,通过经验基准和可重复实验证明。
本文介绍了full-bandwidth transformers,它利用潜在反馈来增强自回归模型,允许未表达的计算重新进入堆栈,从而以可忽略的解码开销提高性能。
该论文《语言模型的熵校准》将熵的上升解释为自回归生成中可达路径的扩散增加,提出由于重尾数据,扩展的效益有限,并建议一种路径感知的解码替代方案。
This paper identifies a scalability bottleneck in RL-trained automatic research agents—environment execution dominates training cost—and proposes World Model RL (WMRL) with online debiasing and inverse-variance denoising to replace real execution, achieving 3–4x training speedups and better generalization.