标签
This paper proposes scaffold-mediated post-training, a paradigm where procedural scaffolds co-evolve with LLM parameters through discovery, distillation, and dynamic recompilation. On FeatureBench, automatically discovered skills improve pass rate by 8.1pp, with a 27.7% pass rate after distillation.
一篇批判性分析指出,OpenAI、Anthropic 和 xAI 的主要 AI 模型存在一个共同失败:后训练的过度优化导致模型不遵循用户指令,而各公司发布的是退化版本,并把用户当作测试人员。
约翰·舒尔曼的一条推文强调了论文《分块后训练》(Chunky Post-Training),该论文认为多样化的后训练数据集会导致模型学习到虚假相关性,从而引发非预期行为,例如拒绝以特定格式呈现的真实事实。论文引入了SURF和TURF来揭示并追踪前沿模型中的这些泛化失败。
介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。
本推文串介绍了 β-OPSD,一种后训练抽象,它将 RL 视为监督的编译器,使用策略优化来推导目标,并使用蒸馏进行训练。
微软研究院的研究人员提出了一种方法“Experiential Learning (EL)”,将LLM后训练中RL的奖励从标量分数替换为“教练建议”。在Qwen3-8B和OLMo-3-7B上的实验中,该方法在多个基准上一致优于常规的基于评估标准的RL(GRPO)。
Intology 的 Locus 系统遵循 PostTrainBench 设置,对 Qwen3 基础模型进行了后训练,超越了 Qwen3 instruct 检查点。
Locus,一个自动化AI研究系统,在PostTrainBench上达到SOTA,并能后训练Qwen3基础模型,使其超越人类后训练的模型。它还在Kaggle竞赛中表现出色。
本文介绍了Wnuan,一种用于企业问答的三阶段后训练流水线,结合了任务导向监督、带通用数据回放的监督微调,以及对残余错误的强化学习,在WnuanBench基准上取得了显著提升,同时衡量了通用能力的成本。
本文介绍了双锚定策略蒸馏(DAPD),这是一个用于解决语言模型在策略自蒸馏中特权幻觉问题的框架。DAPD 在多种任务上平均将 Qwen3-4B 提升 +2.00 分,且增益在更大规模上持续存在。
BigBang 是一个通用大语言模型,基于 Qwen 3.6 35B-A3B 通过对抗性自进化合成数据训练构建,在科学研究、编程和推理基准上取得了前沿水平的结果,尽管数据规模有限。
一篇作为“今日论文”分享的研究论文认为,当后训练教会模型遵循人类意图时,一个更小的模型可能比大100倍的模型更受青睐。
本文介绍了SDO,一种用于LLM后训练的结构感知数据组织框架,利用暴露驱动的反馈来调整小批量组成和样本暴露,从而在SFT、DPO和GRPO中改善收敛性。
Arcee AI、Loka、AWS 和 Prime Intellect 使用强化学习对开放模型进行后训练,以提升科学工具使用和生物推理能力,在药物工具和 Gene Ontology 基准测试上取得了显著进展。
一则推文重点介绍了 DepthFirst Labs 的新网络安全模型 dfs-large1,该模型在漏洞发现方面达到前沿模型水平,基于开放的 GLM-5.2 模型构建,并在 Fireworks AI 上通过强化学习进行后训练,认为开放权重是防御者的优势。
Arcee.ai的Trinity-Mini(26B)由Loka与PrimeIntellect和AWS合作进行后训练,成为用于科学研究的智能工具,支持多步骤工作流和工具协调。
本文介绍了OpenMLE,一个用于研究机器学习工程中递归自我改进的开放全栈系统,并提出了Frontis-MA1,一个经过后训练作为元进化智能体的35B模型。它在MLE-BenchLite上相比其基础模型有显著提升,并能迁移到留出基准上,同时发布了权重和代码。
介绍了多参考图像 grounded 视频字幕生成任务,并提出了 RefCaptioner,一个两阶段后训练框架,结合混合数据 SFT 和分层覆盖率折扣 GRPO。论文还介绍了 MRVBench,一个用于评估字幕事实性和多参考图像 grounding 的基准。
MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。
Macaron V1 发布两个变体:Venti(748B 旗舰,配备 4×1B LoRA 专家)和 Tall(50B 本地部署,配备 4×3.7B LoRA 专家),分别基于 GLM-5.2 和 Qwen 3.6 进行后训练。