training-stability

标签

Cards List
#training-stability

驾驭极端 Token:基于高斯核优势重权重的协方差感知 GRPO

arXiv cs.CL ↗ · 2026-05-13 缓存

本文提出了一种协方差感知的组相对策略优化(GRPO)变体,该方法利用高斯核优势重权重技术来稳定训练熵,并提升大语言模型的推理性能。

0 人收藏 0 人点赞
#training-stability

DeepSeek V4 完整论文发布:FP4 QAT 技术细节与训练稳定性技巧 [D]

Reddit r/MachineLearning ↗ · 2026-05-09

DeepSeek 发布了完整的 V4 论文,详细介绍了 FP4 量化感知训练、MoE 训练稳定性技巧(预判路由与 SwiGLU 截断),以及用于 RLHF 的生成式奖励模型,实现了显著的效率提升——V4-Flash 在 100 万上下文长度下仅需 V3.2 的 10% FLOPs 和 7% 的 KV 缓存。

0 人收藏 0 人点赞
#training-stability

新一代AI模型与最具影响力的研究论文之一。

Reddit r/LocalLLaMA ↗ · 2026-05-08

Token AI发布了一篇研究论文,介绍STAM——一种新型自适应动量优化器,旨在提升训练稳定性并降低内存占用,相比AdamW等标准优化器效果更优。

0 人收藏 0 人点赞
#training-stability

UniSD:面向大型语言模型的统一自蒸馏框架

Hugging Face Daily Papers ↗ · 2026-05-07 缓存

本文提出了 UniSD,这是一种用于适应大型语言模型的统一自蒸馏框架,整合了监督可靠性、表征对齐和训练稳定性的机制。实验结果表明,UniSD 在多个基准测试中均优于基础模型和现有基线方法。

0 人收藏 0 人点赞
#training-stability

列表式策略优化:基于分组的 RLVR 作为 LLM 响应单纯形上的目标投影

Hugging Face Daily Papers ↗ · 2026-05-07 缓存

本文介绍了列表式策略优化(LPO),这是一种用于 RLVR 的方法,通过在响应单纯形上进行散度最小化来显式处理目标投影,从而提高大语言模型(LLM)的训练稳定性和性能。

0 人收藏 0 人点赞
#training-stability

平衡聚合:理解与修复 GRPO 中的聚合偏差

Hugging Face Daily Papers ↗ · 2026-04-14 缓存

本文指出了 GRPO 风格的大语言模型强化学习中存在的聚合偏差问题,并提出了平衡聚合(Balanced Aggregation, BA)方法。该方法通过对正负子集分别计算 token 级均值,从而提高了训练稳定性和最终性能。

0 人收藏 0 人点赞
#training-stability

软自适应策略优化

Papers with Code Trending ↗ · 2025-11-25 缓存

SAPO引入了一个平滑、温度控制的门控机制,以自适应地减弱强化学习中的离策略更新,与使用硬裁剪的方法相比,提升了训练稳定性和性能。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈