training-efficiency

标签

Cards List
#training-efficiency

通过自适应覆盖与聚焦采样实现高效神经场学习

arXiv cs.LG ↗ · 8小时前 缓存

本文提出了 ACES(自适应覆盖感知高效采样)框架,这是一种用于隐式神经表示的结构化采样方法。该框架通过自适应空间划分将区域覆盖与重要性加权解耦,从而在科学场学习任务上实现更快的收敛速度和更低的误差。

0 人收藏 0 人点赞
#training-efficiency

Memorizon:让世界模型在上下文窗口之外完成训练

Hugging Face Daily Papers ↗ · 5天前 缓存

Memorizon 通过相机共视关系让每个被评分的片段检索一个共享的、有界的 top-K 隐变量库,从而在流式世界模型中将长跨度监督与注意力解耦,以极低的额外开销实现超出上下文窗口的一致性重访。与滑动窗口基线相比,检索将重访一致性提升最高达 30%,且结果表明模型确实利用了检索到的隐变量。

0 人收藏 0 人点赞
#training-efficiency

CARE:面向扩散模型的条件感知表示正则化

arXiv cs.LG ↗ · 2026-09-25 缓存

该论文介绍了CARE,这是一个针对扩散模型的条件感知表示正则化框架,通过基于条件相似性动态调节特征分布来提高样本质量和训练效率。在经验上,它在类别到图像和文本到图像任务中显著降低了FID并加快了收敛速度。

0 人收藏 0 人点赞
#training-efficiency

训练文本到图像模型速度提升3.6倍

Hacker News Top ↗ · 2026-09-16 缓存

Linum AI 推出 JiT-DDT,这是一种新颖的编码器-解码器架构,训练文本到图像模型的速度比之前的方法快3.6倍,同时生成更高分辨率的图像。

0 人收藏 0 人点赞
#training-efficiency

XingChen-AGI/Xing4.0-29B-A4B

Hugging Face Models Trending ↗ · 2026-09-16 缓存

Xing4.0-29B-A4B 是一个开源的290亿参数大型语言模型,针对智能体任务和 Ascend NPU 进行了优化,采用 MoE 架构,实现高训练效率,并在基准测试中取得有竞争力的结果。

0 人收藏 0 人点赞
#training-efficiency

@askalphaxiv: “FlashREINFORCE:无批评器单次采样异步强化学习用于智能语言模型” 本文认为可扩展的智能体强化学习…

X AI KOLs Timeline ↗ · 2026-09-15 缓存

FlashREINFORCE 引入了一种无批评器、单次采样的异步强化学习框架,用于智能语言模型,通过立即从每个轨迹学习来提高稳定性和效率。

0 人收藏 0 人点赞
#training-efficiency

LeanGRPO: 消除扩散强化学习中的冗余重计算

arXiv cs.LG ↗ · 2026-09-04 缓存

LeanGRPO通过引入无重计算的训练计划,消除扩散强化学习方法中的冗余重计算,在保持优化目标的同时实现高达1.83倍的速度提升。

0 人收藏 0 人点赞
#training-efficiency

训练即部署:弥合低秩克隆蒸馏中的MLP可达性鸿沟

arXiv cs.LG ↗ · 2026-09-03 缓存

本文提出一种通过训练完整部署矩阵来弥合低秩克隆蒸馏中MLP可达性鸿沟的方法,显著提升了token效率和模型性能,且不增加推理成本。

0 人收藏 0 人点赞
#training-efficiency

反思大语言模型在策略蒸馏 II:单个训练样本

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

本文研究了大语言模型的在策略蒸馏,表明单个训练查询就能实现显著的状态覆盖和对齐,表明该方法更受算法限制而非数据限制。

0 人收藏 0 人点赞
#training-efficiency

更大的批次何时有助于扩展LLM强化学习?

arXiv cs.LG ↗ · 2026-09-01 缓存

本文通过分离算法和系统层面的效应,研究更大的批量大小是否可以减少大语言模型强化学习中的实际达到目标时间,并提供优化决策规则。

0 人收藏 0 人点赞
#training-efficiency

为扩散变换器扩展 Muon

arXiv cs.LG ↗ · 2026-08-24 缓存

本文将 Muon 优化器应用于扩散变换器,参数规模从 13 亿扩展到 150 亿,并引入周期性行式 Muon 以减少计算开销,同时保持相对于 AdamW 的生成质量提升。

0 人收藏 0 人点赞
#training-efficiency

DeltaMomentum:基于键值与Delta规则的各向异性动量更新方法

arXiv cs.LG ↗ · 2026-08-21 缓存

本文提出了DeltaMomentum,一种基于键值的动量更新规则,它根据输入频率调整遗忘率,在各种规模的神经网络训练中展示了更快的收敛速度。

0 人收藏 0 人点赞
#training-efficiency

Data-DPO: 用于LLM后训练中目标模型数据选择的直接偏好优化

arXiv cs.LG ↗ · 2026-08-19 缓存

Data-DPO是一种面向目标模型的LLM监督微调数据选择方法,通过单步探测学习数据偏好,并结合质量分数和多样性,在Vision-Flan和LLaVA-CoT数据集上超越了基线方法。

0 人收藏 0 人点赞
#training-efficiency

从原子到熵:凸域中扩散训练的最优噪声分配

arXiv cs.LG ↗ · 2026-07-24 缓存

本文构建了一个用于扩散模型训练中噪声水平最优分配的统计框架,表明在耦合机制下最优调度是原子化的,而在独立学习机制下遵循平方根熵代理,实验证实了这些预测。

0 人收藏 0 人点赞
#training-efficiency

LongStraw:在固定GPU预算下实现超200万Token的长上下文强化学习

Hugging Face Daily Papers ↗ · 2026-07-16 缓存

LongStraw是一个架构感知的执行栈,用于在固定GPU预算下进行百万Token级别的RL后训练,已在Qwen和GLM模型上展示了高达210万位置的执行能力。

0 人收藏 0 人点赞
#training-efficiency

K-ABENA:基于误差的 N-排除自适应反向传播算法 —— (基于补偿损失的样本排除与无偏梯度估计)

arXiv cs.LG ↗ · 2026-07-08 缓存

提出 K-ABENA 框架,一种选择性梯度计算框架,采用基于补偿损失的样本排除与无偏梯度估计,证明收敛保证,并在多种数据集上实现 28-54% 的计算节省且无性能下降。

0 人收藏 0 人点赞
#training-efficiency

LongCat-2.0

Product Hunt ↗ · 2026-07-07

LongCat-2.0 是一个拥有1.6万亿参数的混合专家模型,完全在定制AI ASIC上训练完成。

0 人收藏 0 人点赞
#training-efficiency

The Context-Ready Transformer

arXiv cs.CL ↗ · 2026-06-29 缓存

本文介绍了上下文就绪 Transformer,一种循环架构,在 Transformer 块之前对 token 进行预上下文化,在匹配或超越标准 Transformer 性能的同时,实现了显著的推理加速(例如在 A100 上达到 1.7 倍),且层数更少。

0 人收藏 0 人点赞
#training-efficiency

Nemotron-Labs-Diffusion-Image:推进掩蔽离散扩散实现高分辨率图像合成

Hugging Face Daily Papers ↗ · 2026-06-29 缓存

本文提出 Nemotron-Labs-Diffusion-Image,一种用于高分辨率文生图的掩蔽离散扩散模型,引入令牌编辑机制和分组交叉熵目标,以改进令牌精炼和训练效率。

0 人收藏 0 人点赞
#training-efficiency

LISA: 面向视觉条件可控生成的似然分数对齐

Hugging Face Daily Papers ↗ · 2026-06-25 缓存

本文介绍了LISA,一种正则化方法,它将侧网络的中间特征与近似的似然分数对齐,以提高基于分数的生成模型中视觉条件可控生成的训练效率和质量。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈