post-training

标签

Cards List
#post-training

同策略Delta蒸馏(OPD^2)

Hugging Face Daily Papers · 2026-07-16 缓存

本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。

0 人收藏 0 人点赞
#post-training

为团队感到无比自豪。经历了无数个深夜,Inkling 终于发布了,我特别想强调 post-……

X AI KOLs Timeline · 2026-07-15 缓存

Thinking Machines 发布了 Inkling,这是一个开源的多模态推理模型,在 post-training RL 方面有创新,实现了稳定扩展到 3000 万+ 次 rollout 和可控的思考投入。该模型展现出压缩推理的特点,即将开放微调。

0 人收藏 0 人点赞
#post-training

跨4国14台Mac的RL后训练

Reddit r/LocalLLaMA · 2026-07-15

关于在分布于4个国家的14台Mac上进行RL后训练的技术说明,强调强化学习的分布式计算。

0 人收藏 0 人点赞
#post-training

@FinanceYF5: Meta CTO 证实,过去一年里,Zuck 不得不进入“创始人模式”。 他也非常认可 Alexandr Wang 去年加入团队这件事。 为了打造最新模型,Meta 进行了一次紧急转向:把数千名员工从原本岗位上抽调出来,用来生成 expe…

X AI KOLs Timeline · 2026-07-14 缓存

Meta CTO确认扎克伯格去年进入了'创始人模式',并赞赏Alexandr Wang的加入。为了打造最新模型,Meta紧急调动数千名员工生成人工引导的expert traces用于后训练,凸显了前沿模型对高质量验证数据的依赖。

0 人收藏 0 人点赞
#post-training

代理探索与可复用引导:通过代理引导更新信号的模块化LLM后训练范式

Hugging Face Daily Papers · 2026-07-13 缓存

提出PUST,一种新颖的LLM后训练框架,该框架通过轻量级代理模型将奖励探索与分布对齐解耦,从而实现可复用的更新信号以及跨模型的高效弱到强增强。

0 人收藏 0 人点赞
#post-training

@VukRosic99: 理想汽车的Mach-Mind-4-Flash:一个仅有3B活跃参数的35B MoE模型,仅通过后训练就能匹配100B级别的模型……

X AI KOLs Timeline · 2026-07-13 缓存

理想汽车的Mach-Mind-4-Flash是一个拥有3B活跃参数的35B MoE模型,通过使用统一的强化学习/在线策略蒸馏损失进行后训练优化,在多个基准测试中达到了匹配或超越100B参数模型的性能。

0 人收藏 0 人点赞
#post-training

LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V6-GGUF

Hugging Face Models Trending · 2026-07-13 缓存

LuffyTheFox 发布了 Qwen3.6-35B-A3B 模型的 GGUF 量化版本,使用 Genesis 算法进行去噪,以减少张量噪声并改进指令遵循能力,该模型基于一个未经审查的激进变体,并与 Hermes 微调数据合并。

0 人收藏 0 人点赞
#post-training

LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF

Hugging Face Models Trending · 2026-07-13 缓存

LuffyTheFox 发布了 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF,这是 Qwen 模型的一个修改版本,使用 Genesis 后训练算法通过自定义 SVD 对 GGUF 格式张量进行信号纯度修复和噪声降低。

0 人收藏 0 人点赞
#post-training

Mach-Mind-4-Flash 技术报告

arXiv cs.CL · 2026-07-13 缓存

本技术报告介绍了 Mach-Mind-4-Flash,一个拥有35B参数(3B激活参数)的混合专家(MoE)代理模型,仅通过后训练优化即可达到或超越100B参数级别的模型性能。它提出了一种新颖的训练基础设施,包括动态多教师调度、多教师在线策略蒸馏以及用于令牌效率的混合中位长度策略优化。

0 人收藏 0 人点赞
#post-training

Learning More from Less: 从后见之明中进行强化学习

arXiv cs.LG · 2026-07-13 缓存

介绍了Learning from Hindsight (LfH)方法,该方法将后见之明重标注应用于视觉-语言-动作模型的强化学习后训练。通过将失败的机器人轨迹重新标注为它们实际完成的任务,LfH在分布外操作任务上实现了5倍的样本效率提升。

0 人收藏 0 人点赞
#post-training

@sheriyuo: 仅3B活跃参数的35B参数MoE代理模型,声称通过后训练即可匹配或超越100B级模型

X AI KOLs Timeline · 2026-07-13 缓存

一个35B参数的MoE模型,仅3B活跃参数,通过后训练强化学习匹配或超越100B级模型,实现显著效率提升。

0 人收藏 0 人点赞
#post-training

@VukRosic99: GRPO后训练使LLMs准确但冗长:在20道MATH-500问题上,一个蒸馏的1.5B模型和一位博士志愿者……

X AI KOLs Timeline · 2026-07-13 缓存

一种名为IAPO(Information-Aware Policy Optimization)的新后训练方法,根据每个token与最终答案的条件互信息为其分配优势,实现了推理长度缩短高达47%,同时提高了数学基准的准确性。

0 人收藏 0 人点赞
#post-training

@seclink: 今日 大模型后训练工程师 面试题 + 标准答案: 什么是大模型的 PBE任务表现 ? 现在编程模型都是如何实现后训练的?

X AI KOLs Following · 2026-07-10 缓存

今日分享了大模型后训练工程师面试题及标准答案,涵盖PBE任务表现定义和编程模型的后训练实现方式。

0 人收藏 0 人点赞
#post-training

RL后训练构建组合推理策略

arXiv cs.CL · 2026-07-09 缓存

本文研究强化学习后训练是否能够将原始技能组合成更高层次的组合策略,使用一个完全可观测的重写语法环境。作者发现,RL通过分阶段的组合机制重新组织原始能力,而拒绝微调则因产生大量无效的捷径式重写而停滞不前。

0 人收藏 0 人点赞
#post-training

@SergioPaniego: 前沿模型在后训练流程中使用蒸馏!到2026年,蒸馏有三个作用:- 将大模型压缩成小模型…

X AI KOLs Timeline · 2026-07-08 缓存

解释了前沿模型后训练流程中蒸馏的三种用途:将大模型压缩成小模型、合并强化学习专家、以及自我学习。还包括一篇详细说明每个方法对应哪些模型的文章。

0 人收藏 0 人点赞
#post-training

@SergioPaniego: https://x.com/SergioPaniego/status/2074863503312044499

X AI KOLs Timeline · 2026-07-08 缓存

一篇关于2026年前沿AI模型如何利用蒸馏技术的文章,涵盖离策略、在策略和自蒸馏阶段,并以Gemma、DeepSeek、GLM、Nemotron和Qwen3为例。

0 人收藏 0 人点赞
#post-training

@adithya_s_k: [必读] 我不知道这怎么会逃过我的注意。这可能是最好的开源端到端后训练…

X AI KOLs Timeline · 2026-07-08 缓存

一个开源的端到端后训练配方,涵盖SFT、RL和测试时扩展,包括模型、数据集和代码。

0 人收藏 0 人点赞
#post-training

FourTune:迈向扩散模型全4比特高效后训练

arXiv cs.LG · 2026-07-08 缓存

FourTune提出了一个全4比特量化框架(W4A4G4),用于扩散模型的高效后训练,采用三分支混合流水线和自定义融合内核,在12B FLUX.1-dev上将内存减少2.25倍,吞吐量提升2.27倍,且无质量损失。

0 人收藏 0 人点赞
#post-training

CurateEvo:面向智能体后训练的数据策展进化

arXiv cs.CL · 2026-07-08 缓存

CurateEvo 是一个以失败为驱动的动态进化框架,用于智能体后训练的数据策展。它利用失败轨迹迭代重写策展策略,在 ACEBench-Agent 和 BFCL-V4 等基准上提升了效果和效率。

0 人收藏 0 人点赞
#post-training

频谱重连用于探索、净化和模型融合

arXiv cs.LG · 2026-07-07 缓存

论文介绍了子空间对齐重连(SAR),这是一种事后编辑方法,能够保留强化学习更新的频谱核心,从而保持推理增益、消除干扰,并实现跨专家模型融合,以极少的参数实现强大性能。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈