training-stability

标签

Cards List
#training-stability

面向LLMs的全流水线FP8强化学习

Hugging Face Daily Papers ↗ · 2026-09-19 缓存

本文提出校准裁剪方法,通过将FP8裁剪界限与高精度分布对齐,来稳定LLMs强化学习中的FP8量化,消除熵激增并恢复性能。

0 人收藏 0 人点赞
#training-stability

密集输出头和稀疏路由器中的Z-Loss反向几何

arXiv cs.LG ↗ · 2026-09-16 缓存

本文分析了Z-loss在人工智能模型训练中的反向传播几何,提供了一个框架来理解和优化密集输出头与稀疏混合专家路由器中的梯度,并在GPT-2和Pythia模型上进行了评估。

0 人收藏 0 人点赞
#training-stability

关于Qwen3.8-Next架构设计:评估、效率与训练稳定性

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

本文介绍了Qwen3.8-Flash-Next,一种稀疏混合专家AI模型,通过混合注意力和n-gram嵌入等架构创新,提升了效率、能力和训练稳定性。

0 人收藏 0 人点赞
#training-stability

归一化低秩适应

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

归一化低秩适应 (NoRA) 通过归一化下投影矩阵来稳定 LoRA 训练,加速收敛并提高性能,无需额外参数或推理成本。

0 人收藏 0 人点赞
#training-stability

LLM预预训练的不稳定性:并非总是有帮助——一项跨多语言的研究

arXiv cs.CL ↗ · 2026-08-11 缓存

本文研究了在多种自然语言上使用人工语言对LLM进行预训练(预预训练)是否始终能提升token效率,发现其收益高度依赖于实验设置和随机种子,尽管对于使用Llama分词器的小模型,稳定收益在多数语言中出现。

0 人收藏 0 人点赞
#training-stability

S2T-RLHF:面向稳定偏好型RLHF的分层信用分配

arXiv cs.AI ↗ · 2026-07-22 缓存

S2T-RLHF提出了一种句子到令牌的奖励分解框架,通过在句子粒度上分配序列级奖励,提高了偏好型RLHF的训练稳定性和鲁棒性,避免了过度细粒度的令牌级精化带来的不稳定性。

0 人收藏 0 人点赞
#training-stability

QUADS:通过量化误差双侧对齐稳定MoE的NVFP4强化学习

arXiv cs.LG ↗ · 2026-07-20 缓存

本文提出QUADS,一种通过对齐训练端和推理生成端的量化误差来稳定混合专家大语言模型的NVFP4强化学习的方法,实现了BF16级别的精度,并且吞吐量高于FP8。

0 人收藏 0 人点赞
#training-stability

Z.ai的稳定异步强化学习(13分钟阅读)

TLDR AI ↗ · 2026-07-10 缓存

本文介绍了单rollout异步优化(SAO)技术,用于解决LLM后训练中异步RL的稳定性和异策略挑战,并证明SAO在智能体编码和推理基准测试上持续优于GRPO。

0 人收藏 0 人点赞
#training-stability

@Chengxing_Xie: 清华大学引入了SAO算法,旨在解决异步强化学习中的离策略漂移和稳定性挑战……

X AI KOLs Timeline ↗ · 2026-07-09 缓存

清华大学的SAO算法解决了大规模语言模型异步强化学习中的稳定性和离策略漂移问题,在智能体编程和推理基准测试上相比GRPO取得了稳定提升,并用于训练GLM-5.2模型。

0 人收藏 0 人点赞
#training-stability

信任区域策略蒸馏

Hugging Face Daily Papers ↗ · 2026-07-06 缓存

信任区域策略蒸馏(TOP-D)通过动态构建近端教师来稳定在线策略蒸馏,提供理论收敛保证,并在数学推理任务中实现零额外开销的实证收益。

0 人收藏 0 人点赞
#training-stability

不要让收益FADE:解析强化学习中的策略梯度权重

arXiv cs.LG ↗ · 2026-07-03 缓存

本文介绍了FADE(Focal Advantage with Dynamic Entropy),一种自适应优势函数,能在大型语言模型的强化学习后训练过程中动态调度梯度权重,与静态基线相比,实现了更快的收敛和更好的准确率-多样性平衡。

0 人收藏 0 人点赞
#training-stability

@cwolferesearch: 我刚刚发表了一篇关于智能体强化学习的博客,涵盖了该领域10多个最新框架。以下是关键要点……链接……

X AI KOLs Timeline ↗ · 2026-06-22 缓存

一篇博客文章,总结了十个最新的智能体强化学习框架和最佳实践,涵盖模块化接口、轨迹结构、动作掩码、过程奖励、优势归一化、可扩展的 rollout、稳定性/探索以及任务课程。

0 人收藏 0 人点赞
#training-stability

RLVR稳定性与Winner Advantage Policy Optimization的梯度视角

Hugging Face Daily Papers ↗ · 2026-06-15 缓存

本文分析了RLVR训练中的token级梯度动态,揭示了优势符号与token概率如何共同影响更新稳定性,并提出了Winner Advantage Policy Optimization(WAPO),该方法仅在正优势的完成序列上执行裁剪更新,以提高稳定性。

0 人收藏 0 人点赞
#training-stability

AAD-1:一步自回归视频生成的非对称对抗性蒸馏

Hugging Face Daily Papers ↗ · 2026-06-02 缓存

AAD-1 引入具有分阶段训练的非对称对抗性蒸馏,以实现一步自回归视频生成,在 VBench 上优于先前方法。

0 人收藏 0 人点赞
#training-stability

@latkins: Fern 是最棒的之一

X AI KOLs Timeline ↗ · 2026-05-26 缓存

Fern 宣布了一种新的正则化技术,解决了 SolidGoldMagikarp 稳定性问题,详情将在后续帖子中说明。

0 人收藏 0 人点赞
#training-stability

DVAO:多奖励强化学习中的动态方差自适应优势优化

Hugging Face Daily Papers ↗ · 2026-05-25 缓存

DVAO 根据奖励方差自适应地加权目标,以提升多奖励强化学习的训练稳定性和多目标性能。

0 人收藏 0 人点赞
#training-stability

全循环Transformer:简单稳定循环

arXiv cs.LG ↗ · 2026-05-20 缓存

本文识别出梯度振荡和残差爆炸是循环Transformer训练不稳定的原因,并提出了全循环Transformer,包含两个无需参数调整的修改(全循环架构和注意力注入),能够稳定训练至12次循环迭代,在下游任务性能上实现了高达13.2%的提升。

0 人收藏 0 人点赞
#training-stability

Learn-by-Wire 训练控制治理:压力下实现稳定与高效的受限自主训练

arXiv cs.AI ↗ · 2026-05-20 缓存

本文介绍了 LBW-Guard,一个位于 AdamW 优化器之上的受限自主训练控制治理层,用于监测遥测数据并在训练过程中施加受限控制,展示了在压力条件下困惑度的改善和训练速度的提升。

0 人收藏 0 人点赞
#training-stability

通过反事实推理路径减少信用分配方差

arXiv cs.LG ↗ · 2026-05-19 缓存

提出隐式行为策略优化(IBPO),一种基于反事实比较的信用分配框架,通过将稀疏的终端奖励转化为对步骤敏感的学习信号,提升了大型语言模型在多步推理任务中的训练稳定性和性能。

0 人收藏 0 人点赞
#training-stability

对我来说,这是人工智能领域一个非常重要的里程碑。

Reddit r/LocalLLaMA ↗ · 2026-05-16

作者宣布发布其首篇AI研究论文STAM(自适应动量的稳定训练),这是一种新的深度学习优化器,旨在解决训练的稳定性和资源效率问题,并邀请AI社区提供反馈。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈