标签
本文研究了用于代码生成LLMs后训练的离线强化学习,表明通过使用现有数据集,无需在线采样,就能提升零样本代码生成的性能。
本研究探讨了韩语27B语言模型中响应风格对齐的脱靶效应,发现针对风格的后训练显著影响了回答倾向和披露率,而没有针对安全性或能力。
LOCUS是一种任务感知低秩后训练方法,可在保持偏好对齐的同时减少语言模型的输出令牌长度,在Pythia-2.8B上实现高达39.84%的减少,且仅需最少的参数更新。
Nebius 推出了 AI Builder Program,为 AI 开发者提供可运行示例、蓝图、课程以及超过 400 美元的信用额度等资源,以促进 AI 系统的构建。
本文介绍了一种数据中心化的流水线,用于通过挖掘推理轨迹、蒸馏指令数据和生成可验证的问答对来对语言模型进行后训练,以增强金融推理能力,展示了在防止灾难性遗忘的同时性能得到提升。
直接多样性优化(DDO)是一种离线后训练方法,它改进了用于序贯决策任务的大语言模型(LLM)代理的成功策略覆盖,并在基准测试(如BabyAI、BabaIsAI和WebShop)中优于其他方法。
论文提出了SALT,一种轻量级的后训练方法,通过向跨语言句子编码器注入跨度级监督来改进词元表示,在多语言词元级基准测试中取得最佳结果,并提升句子级性能。
ActReview 是一个基于反驳引导的后训练框架,通过利用作者回复作为监督信号,生成同行评审的诊断性主张和修改建议,并配备一个由人工精心策划的基准测试集用于评估。
Miles v0.1 是一个开源、生产就绪的系统,用于大规模强化学习和后训练,支持多种后端和模型,如 GLM-5.2,重点关注可扩展性和可访问性。
本仓库提供使用基于梯度的 GSQ 和 RCO 方法对 Qwen3.8-Flash-Next 模型进行的 GGUF 量化,以优化低比特表示,从而实现在标准工具中的高效部署。
本文发现,在后训练期间,大型语言模型可以从截断的推理轨迹而非完整轨迹中获得推理改进,减少冗余的同时,有利于监督微调和强化学习等方法。
MovieGrid是一种多网格后训练范式,它将长视频分解为空间排列的块,以提高多镜头的连贯性和效率,在视频生成中实现了最先进的镜头内和镜头间一致性。
Radixark 分享了一篇博客文章,介绍 Miles 如何通过为视觉语言模型和扩散模型提供共享的后训练设计来支持人工智能模型的多模态学习。
Arize Phoenix 现在支持 GLM-5.3,它在 GLM-5.2 的基础上通过后训练进行了改进,并使用开源强化学习框架在扩展的长期任务环境中进行训练。
XMerge介绍了一种后训练方法,通过跨轴选择和重构重建来压缩基于Transformer的LLM,在激进的深度缩减下超越现有方法并保持性能。
Z.AI 发布 GLM-5.3 Fast,这是一款先进的开放权重AI模型,针对代理编码和网络安全进行优化,采用744B-A40B MoE架构,基准测试有显著改进。
Fal.ai 发布了 H3 Max,这是一款经过后训练的 MiniMax H3 变体,专门针对高质量视频生成进行了优化。据官方宣称,其在提示词遵循度、画面美学和生成速度方面均排名领先——生成 5 秒视频仅需约 3 秒,吞吐量达到官方 H3 模型的 35 倍。
扩展推理和后训练是提升AI模型性能的关键技术,有推测认为像Qwen 4这样的未来模型能够在特定任务上匹配或超越大型参数模型。
文章认为,基础AI模型不再是主要瓶颈,改进现在由训练后增强驱动,如最近发布的GLM5.3和Qwen3.6所见。
本文介绍了World Model RL,通过用学习到的世界模型替代环境执行来扩展自动研究代理,从而将后训练加速3-4倍,并使较小的代理在基准测试中优于较大的代理。