@neural_avb: 如果你仔细想想,2026年的LLM训练其实是一个三步循环:- 用一些数据训练 - 内部测试/运行分类评估…
摘要
这条推文概述了2026年LLM训练的三步循环:用数据训练、运行评估、为表现不佳的任务添加合成数据。它强调了通过开源模型和廉价API进行合法蒸馏的易得性,并指出仅凭推理轨迹训练就能获得高分。
查看缓存全文
缓存时间: 2026/06/09 01:36
仔细想想,2026年的大语言模型训练其实就是三步循环:
- 用某些数据训练它
- 内测/分类评估它的表现
- 在它表现不佳的任务类型上添加新的合成数据
如今开源语言模型及其API定价非常宽松,几乎人人都能轻松创建合法的蒸馏数据集。
你只需要完善在第二步和第三步的决策能力。这基本上占了现阶段的半壁江山——仅靠用数百万条推理轨迹进行训练,就能在许多RLVR任务上直接拿到60%的奖励分数。即使不做强化学习,光靠蒸馏你也能拥有一款2024年的模型——仔细想想吧。
花300美元预算,一个月内就能训练出一个不错的70亿参数模型,然后还能分享给你的女朋友。
现在就开搞SFT最大化吧。
相似文章
从零开始开发开源大语言模型:从预训练到RLHF(PPO/GRPO)
一位开发者分享了从零开始训练一个70亿参数开源大语言模型的进展,该模型基于DeepSeek架构并针对低显存进行了优化,目标是推动AI开发的民主化,并最终超越大型专有模型。
@oliviscusAI:OpenAI 联合创始人刚刚发布了他的个人指南,教你从头训练大语言模型。它叫 llm.c。无需繁琐设置。只…
OpenAI 联合创始人 Andrej Karpathy 发布了 llm.c,这是一份开源指南,教你如何从头训练大语言模型。代码简洁,可在任何硬件上运行,包括 CPU 和 MacBook,并且比标准方法快 7%。
我们一直在分析人们如何在法律与合规任务中使用LLM(GDPR、AI法案等)。
对LLM在法律与合规任务中使用的分析显示,模型常常生成自信但无法验证的引用,引发了对AI输出可靠法律依据的质疑。
@akshay_pachaar: Andrej Karpathy 将LLM训练的整个历史总结为三个名词:- 文本 - 对话 - 及环境…
Andrej Karpathy将LLM训练概括为文本、对话和环境;Prime Intellect的Verifiers是一个开源框架,用于构建和共享LLM的强化学习环境,采用MIT许可证发布,附带一个包含2500多个环境的中枢。
@sadhikesaven: 如今,大语言模型不再仅依靠人类数据构建。它们依赖其他LLM来生成训练数据、筛选语料…
ModSleuth 是一个新工具,用于追踪现代大语言模型的依赖关系,揭示出像 OLMo 3 和 Nemotron 3 这样的模型依赖于数百个其他模型和数据集,凸显了从仅人类数据到AI生成的训练数据的转变。