标签
本文证明,扩展时间点语言模型(仅基于每个日历日期之前可用的文本进行训练)可以显著缩小与无限制模型之间的性能差距,从而在金融和社会科学中实现有效的回测和因果推断。作者训练了多达40亿参数的仅解码器Transformer,使用1万亿按时间顺序过滤的token,并发布了完整流程。
Sam Altman 强调了服务使用量增长 5.6 倍,并赞扬推理团队为满足需求所做的杰出工作,同时警告随着规模继续扩大可能会出现一些故障。
文章质疑了AI遇到性能瓶颈的说法,指出近期发布的模型在任务长度、工具使用和效率上仍在持续改进。文章认为,随着模型的演变,所谓的瓶颈一直在被移动。
一位Atlassian首席工程师分享了已完结的25天Twitter系列帖,内容涵盖系统设计扩容基础,现整理成单一资源。
一个精心整理的开源库列表,用于部署、监控、版本管理、扩展和保护生产机器学习系统。
作者质疑将AI agent部署和扩展到生产环境是否是一个普遍令人沮丧的问题,并提到了诸如幻觉和状态管理等问题。
一份季度报告记录了顶尖AI研究人员之间已有的分歧,包括Karpathy从独立工作转向实验室工作、Sutskever的规模扩展主张与SSI的沉默、以及LeCun对LLMs的下注,凸显了关于规模扩展、AGI时间线和企业AI投资回报率等未解决的争论。
讨论了大规模部署 AI 代理的运营挑战,并将其与 Kubernetes 解决容器编排问题的方式相类比。认为代理生态系统需要类似的基础设施突破。
这篇来自斯坦福大学、英伟达和加州大学伯克利分校的论文介绍了LLM-as-a-Verifier,一种无需训练的验证框架,利用LLM logits的连续评分来提高编码、机器人和医疗领域的准确性,在多个基准上取得了最先进的结果。
这篇来自斯坦福、伯克利和NVIDIA的论文提出了LLM-as-a-Verifier,一个利用token logits进行连续评分的通用验证框架。它在包括Terminal-Bench V2(86.5%)和SWE-Bench Verified(78.2%)在内的多个基准上达到了SOTA,并提供了可以加速强化学习训练的细粒度信号。
Max Rumpf 认为,在训练先进AI模型时,人类反馈正变得过时,他引用了国际象棋、数学和搜索等例子。他主张使用自我对弈和合成数据等无需人类的方法,而Will Depue的一条引用推文则呼吁建立与计算规模相平行的大规模数据基础设施。
CrossBERT将表示学习与令牌重构解耦,实现更高的掩码比例和更好的样本效率,在MTEB和GLUE基准测试上超越BERT。
本文介绍了REDI,这是一个开源框架,通过统一的五阶段流水线(摄取、预处理、转换、结构化、输出)将原始科学数据集自动转换为AI就绪数据,并配有配套工具SetGo以实现FAIR合规性,在多个科学领域进行了评估。
本文描述了将分布式训练运行时 PyTorch Monarch 移植到基于 ROCm 的 AMD GPU 的过程,实现了大规模单控制器容错训练,并解决了大规模 LLM 训练中的可靠性挑战。
Clement Delangue 强调了AI构建者在 Hugging Face 的 Xet 存储系统上存储的庞大数据量,预测其将很快达到艾字节级别。一条回复将其称为“数据的星际之门”,并指出实验室正朝着2030年每年在数据上花费超过1000亿美元的目标迈进。
作者讨论了将AI记忆摄入从数千份扩展到数百万份文档的架构,强调编排和并行性而非原始计算能力,并使用Prefect进行工作流管理。
本文将SOLiD测谎器监督方法扩展到更大的LLM(参数规模高达405B),并在真实的偏好学习场景中进行评估,发现未检测到的欺骗行为随模型规模增大而减少,但该方法对训练数据之间的分布偏移敏感。
Ilya Sutskever 在一次深度采访中提出,AI 行业过去几年的三个核心共识可能都是错误的:Scaling 不再是万能、Benchmark 高分不等于真正智能、RL 反而让模型变笨。他认为预训练和 RL 的红利即将耗尽,AI 已重回研究时代,真正的超智能应像天才少年一样具备强大学习能力,而非静态的知识库。