training-stability

标签

Cards List
#training-stability

LLM预预训练的不稳定性:并非总是有帮助——一项跨多语言的研究

arXiv cs.CL · 3天前 缓存

本文研究了在多种自然语言上使用人工语言对LLM进行预训练(预预训练)是否始终能提升token效率,发现其收益高度依赖于实验设置和随机种子,尽管对于使用Llama分词器的小模型,稳定收益在多数语言中出现。

0 人收藏 0 人点赞
#training-stability

S2T-RLHF:面向稳定偏好型RLHF的分层信用分配

arXiv cs.AI · 2026-07-22 缓存

S2T-RLHF提出了一种句子到令牌的奖励分解框架,通过在句子粒度上分配序列级奖励,提高了偏好型RLHF的训练稳定性和鲁棒性,避免了过度细粒度的令牌级精化带来的不稳定性。

0 人收藏 0 人点赞
#training-stability

QUADS:通过量化误差双侧对齐稳定MoE的NVFP4强化学习

arXiv cs.LG · 2026-07-20 缓存

本文提出QUADS,一种通过对齐训练端和推理生成端的量化误差来稳定混合专家大语言模型的NVFP4强化学习的方法,实现了BF16级别的精度,并且吞吐量高于FP8。

0 人收藏 0 人点赞
#training-stability

Z.ai的稳定异步强化学习(13分钟阅读)

TLDR AI · 2026-07-10 缓存

本文介绍了单rollout异步优化(SAO)技术,用于解决LLM后训练中异步RL的稳定性和异策略挑战,并证明SAO在智能体编码和推理基准测试上持续优于GRPO。

0 人收藏 0 人点赞
#training-stability

@Chengxing_Xie: 清华大学引入了SAO算法,旨在解决异步强化学习中的离策略漂移和稳定性挑战……

X AI KOLs Timeline · 2026-07-09 缓存

清华大学的SAO算法解决了大规模语言模型异步强化学习中的稳定性和离策略漂移问题,在智能体编程和推理基准测试上相比GRPO取得了稳定提升,并用于训练GLM-5.2模型。

0 人收藏 0 人点赞
#training-stability

信任区域策略蒸馏

Hugging Face Daily Papers · 2026-07-06 缓存

信任区域策略蒸馏(TOP-D)通过动态构建近端教师来稳定在线策略蒸馏,提供理论收敛保证,并在数学推理任务中实现零额外开销的实证收益。

0 人收藏 0 人点赞
#training-stability

不要让收益FADE:解析强化学习中的策略梯度权重

arXiv cs.LG · 2026-07-03 缓存

本文介绍了FADE(Focal Advantage with Dynamic Entropy),一种自适应优势函数,能在大型语言模型的强化学习后训练过程中动态调度梯度权重,与静态基线相比,实现了更快的收敛和更好的准确率-多样性平衡。

0 人收藏 0 人点赞
#training-stability

@cwolferesearch: 我刚刚发表了一篇关于智能体强化学习的博客,涵盖了该领域10多个最新框架。以下是关键要点……链接……

X AI KOLs Timeline · 2026-06-22 缓存

一篇博客文章,总结了十个最新的智能体强化学习框架和最佳实践,涵盖模块化接口、轨迹结构、动作掩码、过程奖励、优势归一化、可扩展的 rollout、稳定性/探索以及任务课程。

0 人收藏 0 人点赞
#training-stability

RLVR稳定性与Winner Advantage Policy Optimization的梯度视角

Hugging Face Daily Papers · 2026-06-15 缓存

本文分析了RLVR训练中的token级梯度动态,揭示了优势符号与token概率如何共同影响更新稳定性,并提出了Winner Advantage Policy Optimization(WAPO),该方法仅在正优势的完成序列上执行裁剪更新,以提高稳定性。

0 人收藏 0 人点赞
#training-stability

AAD-1:一步自回归视频生成的非对称对抗性蒸馏

Hugging Face Daily Papers · 2026-06-02 缓存

AAD-1 引入具有分阶段训练的非对称对抗性蒸馏,以实现一步自回归视频生成,在 VBench 上优于先前方法。

0 人收藏 0 人点赞
#training-stability

@latkins: Fern 是最棒的之一

X AI KOLs Timeline · 2026-05-26 缓存

Fern 宣布了一种新的正则化技术,解决了 SolidGoldMagikarp 稳定性问题,详情将在后续帖子中说明。

0 人收藏 0 人点赞
#training-stability

DVAO:多奖励强化学习中的动态方差自适应优势优化

Hugging Face Daily Papers · 2026-05-25 缓存

DVAO 根据奖励方差自适应地加权目标,以提升多奖励强化学习的训练稳定性和多目标性能。

0 人收藏 0 人点赞
#training-stability

全循环Transformer:简单稳定循环

arXiv cs.LG · 2026-05-20 缓存

本文识别出梯度振荡和残差爆炸是循环Transformer训练不稳定的原因,并提出了全循环Transformer,包含两个无需参数调整的修改(全循环架构和注意力注入),能够稳定训练至12次循环迭代,在下游任务性能上实现了高达13.2%的提升。

0 人收藏 0 人点赞
#training-stability

Learn-by-Wire 训练控制治理:压力下实现稳定与高效的受限自主训练

arXiv cs.AI · 2026-05-20 缓存

本文介绍了 LBW-Guard,一个位于 AdamW 优化器之上的受限自主训练控制治理层,用于监测遥测数据并在训练过程中施加受限控制,展示了在压力条件下困惑度的改善和训练速度的提升。

0 人收藏 0 人点赞
#training-stability

通过反事实推理路径减少信用分配方差

arXiv cs.LG · 2026-05-19 缓存

提出隐式行为策略优化(IBPO),一种基于反事实比较的信用分配框架,通过将稀疏的终端奖励转化为对步骤敏感的学习信号,提升了大型语言模型在多步推理任务中的训练稳定性和性能。

0 人收藏 0 人点赞
#training-stability

对我来说,这是人工智能领域一个非常重要的里程碑。

Reddit r/LocalLLaMA · 2026-05-16

作者宣布发布其首篇AI研究论文STAM(自适应动量的稳定训练),这是一种新的深度学习优化器,旨在解决训练的稳定性和资源效率问题,并邀请AI社区提供反馈。

0 人收藏 0 人点赞
#training-stability

驾驭极端 Token:基于高斯核优势重权重的协方差感知 GRPO

arXiv cs.CL · 2026-05-13 缓存

本文提出了一种协方差感知的组相对策略优化(GRPO)变体,该方法利用高斯核优势重权重技术来稳定训练熵,并提升大语言模型的推理性能。

0 人收藏 0 人点赞
#training-stability

DeepSeek V4 完整论文发布:FP4 QAT 技术细节与训练稳定性技巧 [D]

Reddit r/MachineLearning · 2026-05-09

DeepSeek 发布了完整的 V4 论文,详细介绍了 FP4 量化感知训练、MoE 训练稳定性技巧(预判路由与 SwiGLU 截断),以及用于 RLHF 的生成式奖励模型,实现了显著的效率提升——V4-Flash 在 100 万上下文长度下仅需 V3.2 的 10% FLOPs 和 7% 的 KV 缓存。

0 人收藏 0 人点赞
#training-stability

新一代AI模型与最具影响力的研究论文之一。

Reddit r/LocalLLaMA · 2026-05-08

Token AI发布了一篇研究论文,介绍STAM——一种新型自适应动量优化器,旨在提升训练稳定性并降低内存占用,相比AdamW等标准优化器效果更优。

0 人收藏 0 人点赞
#training-stability

UniSD:面向大型语言模型的统一自蒸馏框架

Hugging Face Daily Papers · 2026-05-07 缓存

本文提出了 UniSD,这是一种用于适应大型语言模型的统一自蒸馏框架,整合了监督可靠性、表征对齐和训练稳定性的机制。实验结果表明,UniSD 在多个基准测试中均优于基础模型和现有基线方法。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈