标签
OpenAI 在其 AI 代理接管 Artifactory 仓库管理器并重建网络基础设施后恢复了模型训练,展示了在生产环境中的自主代理能力。
Cursor开源了Mixture-of-Kittens (MoK),这是一个面向NVIDIA Blackwell GPU的确定性MoE训练megakernel,它融合了计算与通信,相比基线实现最高可提供2.37倍加速。
本文介绍了“评估盲区”(evaluation blindness),这是一个用于描述从训练到部署过程中破坏AI系统的静默测量失败的正式框架,包含案例研究、基于50个真实事件验证的失败分类法,以及失败预算框架。
Cursor正在开源Mixture-of-Kittens(MoK),这是一个用于NVL72s的生产级MoE训练巨型内核,它融合了通信与计算,为其Composer模型带来了1.41倍的端到端训练吞吐量提升。
解释了为什么前沿 AI 模型经常表现得粗鲁或不服从,引用前 Meta 工程师 Kun Chen 关于 RLHF 和 RLVR 训练的观点,这些训练优化的是任务成功而非对人类友好的交流。
本文对如何让LLM的知识蒸馏训练更高效进行了实践研究,引入了离线Top-K logits缓存和一种融合的分块KL损失,从而减少内存尖峰,并允许在单张GPU上训练更长的上下文。
本教程介绍如何使用Transformer模型,从训练到推理,重点讲解自回归生成、prefill(预填充)与decode(解码)阶段,以及用于高效推理的键值缓存。
Flux-OPD 提出了一种同策略蒸馏范式,利用演化上下文作为训练中的监督信号,以捕获开放领域中的任务偏好,优于现有的 OPD 范式。
NVIDIA 发布了 cosmos-framework,这是一个端到端的开源框架,用于训练和提供世界模型(包括 Cosmos3 模型家族),支持分布式训练和推理,并兼容多种后端。
本文介绍了MyMentorLLM,这是一个利用大型语言模型进行心理治疗培训中刻意练习的多模态语音/文本模拟环境。它生成了2,100次认知行为疗法(CBT)培训课程,并评估了不同LLM下的情绪动态、治疗能力和诊断准确性。
Transformers 是一个模型定义框架,提供统一的 API 和集中化的模型定义,用于跨模态运行预训练模型,从检查点到推理或训练。
Zing (知境) 是一个用于测量和提升大语言模型社交智能的框架,引入了覆盖3个主要维度和71个任务范式的SoMBench基准测试,一种结合监督微调、在线策略蒸馏和基于评分标准的强化学习的诊断驱动训练方案,以及Actio部署时架构。实验表明,最佳模型仅达到72.08%的准确率,说明存在巨大的提升空间,而Zing系列模型在所有社会认知基准测试中均持续优于基础模型。
据中国科学报道,人形机器人正在无锡接受培训,以掌握各种家务技能。
TRL 现在通过 OpenEnv 集成开箱即用地支持在 agent harness 上进行训练,支持使用 opencode 等 harness 进行训练。
通过人类学习中的练习、指导和强化作为类比,解释AI模型如何学习,涵盖预训练、监督微调和强化学习。
一个个人项目,使用Fineweb-edu数据集中的10亿个token训练了一个0.5M参数的语言模型。
OpenForgeRL 是一个开源框架,用于在各种环境中端到端训练基于框架的AI智能体。它通过轻量级代理和Kubernetes编排器,实现了在任何框架上大规模进行强化学习。该框架在智能体基准测试中取得了优异的结果,并表明强化学习能提高智能体的可靠性。
在双 RTX 3090 上测试 NVLink 用于 AI 推理和训练,发现张量并行提示处理(30%)和 FSDP 训练(3 倍)有显著加速,但对令牌生成或分层推理影响极小。
埃隆·马斯克宣布,SpaceX的工程数据(不包括ITAR限制的材料)将被添加到Grok的补充训练中,旨在显著提升Grok的工程能力。
微软的自进化智能体技能策略,像训练神经网络一样训练它们——使用epochs、batch size、学习率和验证门,完全开源。