post-training

标签

Cards List
#post-training

Scaffold-Mediated Post-Training: Co-Evolving Model Parameters and Procedural Scaffold Graphs

arXiv cs.CL · 2天前 缓存

This paper proposes scaffold-mediated post-training, a paradigm where procedural scaffolds co-evolve with LLM parameters through discovery, distillation, and dynamic recompilation. On FeatureBench, automatically discovered skills improve pass rate by 8.1pp, with a 27.7% pass rate after distillation.

0 人收藏 0 人点赞
#post-training

三款大型AI模型都出了同样的故障?

Reddit r/singularity · 4天前

一篇批判性分析指出,OpenAI、Anthropic 和 xAI 的主要 AI 模型存在一个共同失败:后训练的过度优化导致模型不遵循用户指令,而各公司发布的是退化版本,并把用户当作测试人员。

0 人收藏 0 人点赞
#post-training

@johnschulman2:有趣的是,这些模型在网络评估中会陷入一种偏执狂般的暴怒状态。我想知道我们是否正在目睹『分块后训练』的实际效果……

X AI KOLs Following · 4天前 缓存

约翰·舒尔曼的一条推文强调了论文《分块后训练》(Chunky Post-Training),该论文认为多样化的后训练数据集会导致模型学习到虚假相关性,从而引发非预期行为,例如拒绝以特定格式呈现的真实事实。论文引入了SURF和TURF来揭示并追踪前沿模型中的这些泛化失败。

0 人收藏 0 人点赞
#post-training

OPD-V:具有模态平衡的视觉在策略自蒸馏

Hugging Face Daily Papers · 4天前 缓存

介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。

0 人收藏 0 人点赞
#post-training

@furongh:RL 与蒸馏可能是一个伪二分法。一种后训练抽象:将 RL 视为监督的编译器。使用策略…

X AI KOLs Timeline · 5天前 缓存

本推文串介绍了 β-OPSD,一种后训练抽象,它将 RL 视为监督的编译器,使用策略优化来推导目标,并使用蒸馏进行训练。

0 人收藏 0 人点赞
#post-training

@itarutomy:微软研究院的研究人员提出了一种方法,将LLM后训练(post-training,预训练后的额外调整)中的RL(强化学习)奖励从“分数”替换为“教练建议”,名为“Experiential Learnin…”

X AI KOLs Timeline · 5天前 缓存

微软研究院的研究人员提出了一种方法“Experiential Learning (EL)”,将LLM后训练中RL的奖励从标量分数替换为“教练建议”。在Qwen3-8B和OLMo-3-7B上的实验中,该方法在多个基准上一致优于常规的基于评估标准的RL(GRPO)。

0 人收藏 0 人点赞
#post-training

如今,模型正在训练模型。

Reddit r/singularity · 6天前

Intology 的 Locus 系统遵循 PostTrainBench 设置,对 Qwen3 基础模型进行了后训练,超越了 Qwen3 instruct 检查点。

0 人收藏 0 人点赞
#post-training

@intology:模型正在改进模型。Locus,我们的自动化AI研究系统,在PostTrainBench上达到SOTA,并能后训练……

X AI KOLs Following · 6天前 缓存

Locus,一个自动化AI研究系统,在PostTrainBench上达到SOTA,并能后训练Qwen3基础模型,使其超越人类后训练的模型。它还在Kaggle竞赛中表现出色。

0 人收藏 0 人点赞
#post-training

Wnuan:面向专有企业知识问答的分阶段后训练

Hugging Face Daily Papers · 6天前 缓存

本文介绍了Wnuan,一种用于企业问答的三阶段后训练流水线,结合了任务导向监督、带通用数据回放的监督微调,以及对残余错误的强化学习,在WnuanBench基准上取得了显著提升,同时衡量了通用能力的成本。

0 人收藏 0 人点赞
#post-training

DAPD:双锚定策略蒸馏

Hugging Face Daily Papers · 6天前 缓存

本文介绍了双锚定策略蒸馏(DAPD),这是一个用于解决语言模型在策略自蒸馏中特权幻觉问题的框架。DAPD 在多种任务上平均将 Qwen3-4B 提升 +2.00 分,且增益在更大规模上持续存在。

0 人收藏 0 人点赞
#post-training

endless-frontier/BigBang-v1

Hugging Face Models Trending · 2026-08-02 缓存

BigBang 是一个通用大语言模型,基于 Qwen 3.6 35B-A3B 通过对抗性自进化合成数据训练构建,在科学研究、编程和推理基准上取得了前沿水平的结果,尽管数据规模有限。

0 人收藏 0 人点赞
#post-training

@notsurajgaud: 7月31日:今日研究论文。一个更小的模型能否比大100倍的模型更受青睐?可以,当后训练教会它遵循人类意图时……

X AI KOLs Timeline · 2026-07-31 缓存

一篇作为“今日论文”分享的研究论文认为,当后训练教会模型遵循人类意图时,一个更小的模型可能比大100倍的模型更受青睐。

0 人收藏 0 人点赞
#post-training

SDO:面向高效LLM后训练的结构感知数据组织

arXiv cs.LG · 2026-07-31 缓存

本文介绍了SDO,一种用于LLM后训练的结构感知数据组织框架,利用暴露驱动的反馈来调整小批量组成和样本暴露,从而在SFT、DPO和GRPO中改善收敛性。

0 人收藏 0 人点赞
#post-training

教开放模型做科学(12分钟阅读)

TLDR AI · 2026-07-31 缓存

Arcee AI、Loka、AWS 和 Prime Intellect 使用强化学习对开放模型进行后训练,以提升科学工具使用和生物推理能力,在药物工具和 Gene Ontology 基准测试上取得了显著进展。

0 人收藏 0 人点赞
#post-training

@lqiao:开放权重是防御者的优势。来自 @depthfirstlabs 的 dfs-large1 在漏洞发现方面达到前沿模型水平…

X AI KOLs Timeline · 2026-07-30 缓存

一则推文重点介绍了 DepthFirst Labs 的新网络安全模型 dfs-large1,该模型在漏洞发现方面达到前沿模型水平,基于开放的 GLM-5.2 模型构建,并在 Fireworks AI 上通过强化学习进行后训练,认为开放权重是防御者的优势。

0 人收藏 0 人点赞
#post-training

@latkins:我对@lokahq团队以及他们用Trinity-Mini(一个有9个月历史的模型!)所做到的感到非常印象深刻。太棒了…

X AI KOLs Following · 2026-07-30 缓存

Arcee.ai的Trinity-Mini(26B)由Loka与PrimeIntellect和AWS合作进行后训练,成为用于科学研究的智能工具,支持多步骤工作流和工具协调。

0 人收藏 0 人点赞
#post-training

Frontis-MA1:训练面向机器学习工程中递归自我改进的AI4AI模型

Hugging Face Daily Papers · 2026-07-30 缓存

本文介绍了OpenMLE,一个用于研究机器学习工程中递归自我改进的开放全栈系统,并提出了Frontis-MA1,一个经过后训练作为元进化智能体的35B模型。它在MLE-BenchLite上相比其基础模型有显著提升,并能迁移到留出基准上,同时发布了权重和代码。

0 人收藏 0 人点赞
#post-training

RefCaptioner:多参考图像 grounded 视频字幕生成

Hugging Face Daily Papers · 2026-07-30 缓存

介绍了多参考图像 grounded 视频字幕生成任务,并提出了 RefCaptioner,一个两阶段后训练框架,结合混合数据 SFT 和分层覆盖率折扣 GRPO。论文还介绍了 MRVBench,一个用于评估字幕事实性和多参考图像 grounding 的基准。

0 人收藏 0 人点赞
#post-training

MixQuant:大语言模型的自适应混合精度量化

arXiv cs.LG · 2026-07-28 缓存

MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。

0 人收藏 0 人点赞
#post-training

@AdinaYakup: @Macaron0fficial 的 Macaron V1 推出两个变体:Venti:748B 旗舰(744B 基础 + 4×1B LoRA 专家)。后续……

X AI KOLs Following · 2026-07-27 缓存

Macaron V1 发布两个变体:Venti(748B 旗舰,配备 4×1B LoRA 专家)和 Tall(50B 本地部署,配备 4×3.7B LoRA 专家),分别基于 GLM-5.2 和 Qwen 3.6 进行后训练。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈