标签
SkewAdam是一种针对混合专家模型的新型优化器,它分层分配优化器状态至骨干网络、专家和路由器,将内存占用降至AdamW的2.6%,同时在受控对比中实现了更优的验证困惑度。
文章提出,通过精心设计的harness来诱导组合,Transformer可以泛化到新任务,而无需模型本身具备泛化能力。研究表明,RLMs可以从短任务泛化到8-32倍长的任务,并且跨领域泛化。
一篇文章解释 LLM 如何在推理和训练中切换低、中、高努力推理。
本文介绍了Tantalus,一个通过真实挑战学习如何保护智能体AI系统免受间接提示注入和数据泄露的免费平台。
一位用户发布了微软从未公开发布的 BitNet 训练器,以及用于训练和推理的自定义内核,同时强调了微软的 bitnet.cpp 推理框架,该框架可在 CPU 和 GPU 上实现快速 1 位 LLM 推理。
Prime Intellect 发布了 verifiers v1 和 prime-rl 0.7.0,这是一个强化学习训练工具,完全支持 verifiers,包含多种算法如 GRPO 和 OPD,并进行了性能改进。
一篇Substack文章解释了LLM中的doom loop问题——模型会无休止地重复token,并介绍了Liquid AI提出的Final Token Preference Optimization(FTPO)方法,用于在微调过程中检测并修复此类循环。
一份构建结构化智能体轨迹数据集的实用指南,用于训练使用工具的智能体,强调设计包含六个关键部分的轨迹的重要性,并将轨迹视为数据资产而非日志。
Prime Intellect工程师演示了一种方法,通过开放互联网使用分布式强化学习在30分钟内训练推理模型,利用Prime-RL、LLM评判器和多云GPU,使开放模型无需拥有数据中心即可与封闭实验室竞争。
Fable 5 今晚将退出其订阅服务;强烈建议用户在午夜前训练一个替代模型以保留其能力。
据Chubby分享,GPT-5.6两个月前已完成训练并向部分用户开放早期体验,但未公开发布。
讨论了一种将Computer Use与前沿模型相结合的AI框架,重点在于模型能力和训练,而非文件/浏览器或MCP相关主题。
Four Over Six(4/6)为NVFP4量化引入了自适应块缩放,以最小开销降低量化误差,同时改善了大语言模型的训练和训练后量化。
介绍LiST,一种利用利普希茨约束实现鲁棒且校准神经网络的训练范式,在准确率-鲁棒性帕累托前沿上选择最优工作点。在CIFAR和Tiny-ImageNet上展示了具有竞争力的性能。
TorchCode是一个开源刷题平台,将手写深度学习算子做成LeetCode模式,包含40道高频面试题,提供自动评测和提示,支持Docker一键部署和Hugging Face Spaces在线使用。
一本与LLM Engineer's Handbook配套的开源指南,提供了构建生产级LLM系统的完整蓝图,涵盖合成数据生成、训练(含DPO)、RAG、AWS部署、评估和监控。
一条推文强调,新员工专注于数据标注而不是立即设置GPU训练,这对于机器学习岗位来说是一个好迹象。
TorchJD 是一个用于在 PyTorch 中训练具有多个损失的模型的库,实现了标量化和雅可比下降两种方法。它已被 PyTorch 生态系统接受,并致力于成为多损失训练的首选库。