@neural_avb: 如果你仔细想想,2026年的LLM训练其实是一个三步循环:- 用一些数据训练 - 内部测试/运行分类评估…
摘要
这条推文概述了2026年LLM训练的三步循环:用数据训练、运行评估、为表现不佳的任务添加合成数据。它强调了通过开源模型和廉价API进行合法蒸馏的易得性,并指出仅凭推理轨迹训练就能获得高分。
查看缓存全文
缓存时间: 2026/06/09 01:36
仔细想想,2026年的大语言模型训练其实就是三步循环:
- 用某些数据训练它
- 内测/分类评估它的表现
- 在它表现不佳的任务类型上添加新的合成数据
如今开源语言模型及其API定价非常宽松,几乎人人都能轻松创建合法的蒸馏数据集。
你只需要完善在第二步和第三步的决策能力。这基本上占了现阶段的半壁江山——仅靠用数百万条推理轨迹进行训练,就能在许多RLVR任务上直接拿到60%的奖励分数。即使不做强化学习,光靠蒸馏你也能拥有一款2024年的模型——仔细想想吧。
花300美元预算,一个月内就能训练出一个不错的70亿参数模型,然后还能分享给你的女朋友。
现在就开搞SFT最大化吧。
相似文章
@_avichawla: https://x.com/_avichawla/status/2088536550552605174
这篇文章总结了八种基于Google、OpenAI和Anthropic研究的推理时技术,用于改进大语言模型推理,包括权衡和实用注意事项。
从零开始开发开源大语言模型:从预训练到RLHF(PPO/GRPO)
一位开发者分享了从零开始训练一个70亿参数开源大语言模型的进展,该模型基于DeepSeek架构并针对低显存进行了优化,目标是推动AI开发的民主化,并最终超越大型专有模型。
@oliviscusAI:OpenAI 联合创始人刚刚发布了他的个人指南,教你从头训练大语言模型。它叫 llm.c。无需繁琐设置。只…
OpenAI 联合创始人 Andrej Karpathy 发布了 llm.c,这是一份开源指南,教你如何从头训练大语言模型。代码简洁,可在任何硬件上运行,包括 CPU 和 MacBook,并且比标准方法快 7%。
我们一直在分析人们如何在法律与合规任务中使用LLM(GDPR、AI法案等)。
对LLM在法律与合规任务中使用的分析显示,模型常常生成自信但无法验证的引用,引发了对AI输出可靠法律依据的质疑。
深入vLLM:高吞吐量LLM推理系统剖析(2025)
深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。