post-training

标签

Cards List
#post-training

性能、效率与崩溃——代码LLMs离线后训练的优势与挑战

arXiv cs.LG ↗ · 2026-09-14 缓存

本文研究了用于代码生成LLMs后训练的离线强化学习,表明通过使用现有数据集,无需在线采样,就能提升零样本代码生成的性能。

0 人收藏 0 人点赞
#post-training

韩语27B语言模型中响应风格对齐的脱靶效应

arXiv cs.AI ↗ · 2026-09-12 缓存

本研究探讨了韩语27B语言模型中响应风格对齐的脱靶效应,发现针对风格的后训练显著影响了回答倾向和披露率,而没有针对安全性或能力。

0 人收藏 0 人点赞
#post-training

LOCUS: 面向令牌高效语言生成的任务感知低秩后训练

arXiv cs.CL ↗ · 2026-09-11 缓存

LOCUS是一种任务感知低秩后训练方法,可在保持偏好对齐的同时减少语言模型的输出令牌长度,在Pythia-2.8B上实现高达39.84%的减少,且仅需最少的参数更新。

0 人收藏 0 人点赞
#post-training

@rohanpaul_ai: 来自 Nebius 的一个非常强大的优惠,适用于 AI 开发者。用于学习推理流程、编排、检索……

X AI KOLs Following ↗ · 2026-09-10 缓存

Nebius 推出了 AI Builder Program,为 AI 开发者提供可运行示例、蓝图、课程以及超过 400 美元的信用额度等资源,以促进 AI 系统的构建。

0 人收藏 0 人点赞
#post-training

金融推理的数据中心化后训练:挖掘、蒸馏与可验证学习

arXiv cs.CL ↗ · 2026-09-10 缓存

本文介绍了一种数据中心化的流水线,用于通过挖掘推理轨迹、蒸馏指令数据和生成可验证的问答对来对语言模型进行后训练,以增强金融推理能力,展示了在防止灾难性遗忘的同时性能得到提升。

0 人收藏 0 人点赞
#post-training

偏好后训练中多样成功轨迹的直接多样性优化

arXiv cs.CL ↗ · 2026-09-10 缓存

直接多样性优化(DDO)是一种离线后训练方法,它改进了用于序贯决策任务的大语言模型(LLM)代理的成功策略覆盖,并在基准测试(如BabyAI、BabaIsAI和WebShop)中优于其他方法。

0 人收藏 0 人点赞
#post-training

通过SALT实现跨语言词元表示的改进

arXiv cs.CL ↗ · 2026-09-10 缓存

论文提出了SALT,一种轻量级的后训练方法,通过向跨语言句子编码器注入跨度级监督来改进词元表示,在多语言词元级基准测试中取得最佳结果,并提升句子级性能。

0 人收藏 0 人点赞
#post-training

ActReview:基于反驳引导的训练数据与评分奖励,用于可操作同行评审生成

Hugging Face Daily Papers ↗ · 2026-09-08 缓存

ActReview 是一个基于反驳引导的后训练框架,通过利用作者回复作为监督信号,生成同行评审的诊断性主张和修改建议,并配备一个由人工精心策划的基准测试集用于评估。

0 人收藏 0 人点赞
#post-training

Miles v0.1:生产级后训练

Hugging Face Daily Papers ↗ · 2026-09-08 缓存

Miles v0.1 是一个开源、生产就绪的系统,用于大规模强化学习和后训练,支持多种后端和模型,如 GLM-5.2,重点关注可扩展性和可访问性。

0 人收藏 0 人点赞
#post-training

ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF

Hugging Face Models Trending ↗ · 2026-09-07 缓存

本仓库提供使用基于梯度的 GSQ 和 RCO 方法对 Qwen3.8-Flash-Next 模型进行的 GGUF 量化,以优化低比特表示,从而实现在标准工具中的高效部署。

0 人收藏 0 人点赞
#post-training

重新审视后训练中的完整推理轨迹

Hugging Face Daily Papers ↗ · 2026-09-07 缓存

本文发现,在后训练期间,大型语言模型可以从截断的推理轨迹而非完整轨迹中获得推理改进,减少冗余的同时,有利于监督微调和强化学习等方法。

0 人收藏 0 人点赞
#post-training

长形式多镜头视频生成的多网格后训练

Hugging Face Daily Papers ↗ · 2026-09-06 缓存

MovieGrid是一种多网格后训练范式,它将长视频分解为空间排列的块,以提高多镜头的连贯性和效率,在视频生成中实现了最先进的镜头内和镜头间一致性。

0 人收藏 0 人点赞
#post-training

@radixark: 现实世界是多模态的。为了人工智能理解和重现它,模型需要在多种模态之间学习。在我们的最新……

X AI KOLs Timeline ↗ · 2026-09-03 缓存

Radixark 分享了一篇博客文章,介绍 Miles 如何通过为视觉语言模型和扩散模型提供共享的后训练设计来支持人工智能模型的多模态学习。

0 人收藏 0 人点赞
#post-training

@ArizePhoenix: Arize Phoenix 现在支持 https://Z.ai GLM-5.3 使用与 GLM-5.2 相同的基础。所有提升都来自后训练。 http…

X AI KOLs Following ↗ · 2026-09-03 缓存

Arize Phoenix 现在支持 GLM-5.3,它在 GLM-5.2 的基础上通过后训练进行了改进,并使用开源强化学习框架在扩展的长期任务环境中进行训练。

0 人收藏 0 人点赞
#post-training

XMerge:跨轴选择与重构层合并用于LLM深度压缩

arXiv cs.LG ↗ · 2026-09-03 缓存

XMerge介绍了一种后训练方法,通过跨轴选择和重构重建来压缩基于Transformer的LLM,在激进的深度缩减下超越现有方法并保持性能。

0 人收藏 0 人点赞
#post-training

@baseten: 今天我们发布GLM-5.3 Fast:迄今为止最智能的开放权重模型之一,TPS更高。

X AI KOLs Timeline ↗ · 2026-09-03 缓存

Z.AI 发布 GLM-5.3 Fast,这是一款先进的开放权重AI模型,针对代理编码和网络安全进行优化,采用744B-A40B MoE架构,基准测试有显著改进。

0 人收藏 0 人点赞
#post-training

fal 发布 H3 Max

Product Hunt ↗ · 2026-09-02 缓存

Fal.ai 发布了 H3 Max,这是一款经过后训练的 MiniMax H3 变体,专门针对高质量视频生成进行了优化。据官方宣称,其在提示词遵循度、画面美学和生成速度方面均排名领先——生成 5 秒视频仅需约 3 秒,吞吐量达到官方 H3 模型的 35 倍。

0 人收藏 0 人点赞
#post-training

Qwen 会称王吗?

Reddit r/LocalLLaMA ↗ · 2026-09-02

扩展推理和后训练是提升AI模型性能的关键技术,有推测认为像Qwen 4这样的未来模型能够在特定任务上匹配或超越大型参数模型。

0 人收藏 0 人点赞
#post-training

基础模型已不再是瓶颈(15分钟阅读)

TLDR AI ↗ · 2026-08-31 缓存

文章认为,基础AI模型不再是主要瓶颈,改进现在由训练后增强驱动,如最近发布的GLM5.3和Qwen3.6所见。

0 人收藏 0 人点赞
#post-training

通过世界模型扩展自动研究代理

Hugging Face Daily Papers ↗ · 2026-08-29 缓存

本文介绍了World Model RL,通过用学习到的世界模型替代环境执行来扩展自动研究代理,从而将后训练加速3-4倍,并使较小的代理在基准测试中优于较大的代理。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈