标签
本文提出了 ACES(自适应覆盖感知高效采样)框架,这是一种用于隐式神经表示的结构化采样方法。该框架通过自适应空间划分将区域覆盖与重要性加权解耦,从而在科学场学习任务上实现更快的收敛速度和更低的误差。
Memorizon 通过相机共视关系让每个被评分的片段检索一个共享的、有界的 top-K 隐变量库,从而在流式世界模型中将长跨度监督与注意力解耦,以极低的额外开销实现超出上下文窗口的一致性重访。与滑动窗口基线相比,检索将重访一致性提升最高达 30%,且结果表明模型确实利用了检索到的隐变量。
该论文介绍了CARE,这是一个针对扩散模型的条件感知表示正则化框架,通过基于条件相似性动态调节特征分布来提高样本质量和训练效率。在经验上,它在类别到图像和文本到图像任务中显著降低了FID并加快了收敛速度。
Linum AI 推出 JiT-DDT,这是一种新颖的编码器-解码器架构,训练文本到图像模型的速度比之前的方法快3.6倍,同时生成更高分辨率的图像。
Xing4.0-29B-A4B 是一个开源的290亿参数大型语言模型,针对智能体任务和 Ascend NPU 进行了优化,采用 MoE 架构,实现高训练效率,并在基准测试中取得有竞争力的结果。
FlashREINFORCE 引入了一种无批评器、单次采样的异步强化学习框架,用于智能语言模型,通过立即从每个轨迹学习来提高稳定性和效率。
LeanGRPO通过引入无重计算的训练计划,消除扩散强化学习方法中的冗余重计算,在保持优化目标的同时实现高达1.83倍的速度提升。
本文提出一种通过训练完整部署矩阵来弥合低秩克隆蒸馏中MLP可达性鸿沟的方法,显著提升了token效率和模型性能,且不增加推理成本。
本文研究了大语言模型的在策略蒸馏,表明单个训练查询就能实现显著的状态覆盖和对齐,表明该方法更受算法限制而非数据限制。
本文通过分离算法和系统层面的效应,研究更大的批量大小是否可以减少大语言模型强化学习中的实际达到目标时间,并提供优化决策规则。
本文将 Muon 优化器应用于扩散变换器,参数规模从 13 亿扩展到 150 亿,并引入周期性行式 Muon 以减少计算开销,同时保持相对于 AdamW 的生成质量提升。
本文提出了DeltaMomentum,一种基于键值的动量更新规则,它根据输入频率调整遗忘率,在各种规模的神经网络训练中展示了更快的收敛速度。
Data-DPO是一种面向目标模型的LLM监督微调数据选择方法,通过单步探测学习数据偏好,并结合质量分数和多样性,在Vision-Flan和LLaVA-CoT数据集上超越了基线方法。
本文构建了一个用于扩散模型训练中噪声水平最优分配的统计框架,表明在耦合机制下最优调度是原子化的,而在独立学习机制下遵循平方根熵代理,实验证实了这些预测。
LongStraw是一个架构感知的执行栈,用于在固定GPU预算下进行百万Token级别的RL后训练,已在Qwen和GLM模型上展示了高达210万位置的执行能力。
提出 K-ABENA 框架,一种选择性梯度计算框架,采用基于补偿损失的样本排除与无偏梯度估计,证明收敛保证,并在多种数据集上实现 28-54% 的计算节省且无性能下降。
本文介绍了上下文就绪 Transformer,一种循环架构,在 Transformer 块之前对 token 进行预上下文化,在匹配或超越标准 Transformer 性能的同时,实现了显著的推理加速(例如在 A100 上达到 1.7 倍),且层数更少。
本文提出 Nemotron-Labs-Diffusion-Image,一种用于高分辨率文生图的掩蔽离散扩散模型,引入令牌编辑机制和分组交叉熵目标,以改进令牌精炼和训练效率。
本文介绍了LISA,一种正则化方法,它将侧网络的中间特征与近似的似然分数对齐,以提高基于分数的生成模型中视觉条件可控生成的训练效率和质量。