标签
论文提出了在线策略逆蒸馏(OPRD)方法,该方法通过沿教师策略偏移方向放大验证器支持的策略梯度,使更强的AI模型能够超越较弱的监督者,在蒸馏场景中以更少的更新次数获得更高性能。
本文提出将深度光流立体方法蒸馏到单卫星模型中,以高效获取密集三维风场,在某些光谱波段上提高了传统大气运动矢量的精度。
本文介绍了教师门控在线策略蒸馏(TGOPD),一种在提示级别验证教师可靠性的方法,以改善在线策略蒸馏,从而在异步设置中实现更好的性能和更高的GPU利用率。
论文介绍了PersonaLink,一种无需训练的方法,它将用户历史蒸馏为有界人格,在分类任务上匹配检索,但在回归任务上不匹配,突显了任务类型的不对称性。
本文提出一种通过训练完整部署矩阵来弥合低秩克隆蒸馏中MLP可达性鸿沟的方法,显著提升了token效率和模型性能,且不增加推理成本。
FlashRender是一个几步生成式渲染框架,通过对齐表示和使用均值流目标来加速视频合成,在显著降低采样成本的同时,达到与多步方法相当的质量。
DISTAL 是一个双先验框架,它结合自监督组分预训练和结构感知知识蒸馏,以实现低数据环境下的稳健结构无关材料性质预测,提升多个基准任务的表现。
作者描述了一个实验,其中像Claude Code和Codex这样的AI代理被提供一个工作手册,以记录它们在任务中的决策和权衡,探讨这些推理痕迹作为蒸馏信号的潜在用途。
FastVideo 发布了一款开源的、经过后训练的 Minimax H3 模型,它能以50倍的速度生成视频,仅需3秒计算时间即可输出5秒的视频内容,适用于文本到音频视频的生成。
本文表明,扩展任务外模型生成的蒸馏数据可以放大学生的潜在教师特质,即使数据看似无害,这表明在AI训练中需要特质感知的筛选。
EditaLive是一个用于实时以人为中心的直播视频编辑的新颖框架,它通过因果生成和蒸馏技术来适应图像动画模型,以实现高效的流式推理。
本文提出了一种Sparse-Activation-ReLU (SAR)层,用于低延迟、高能效的虚拟感知,在延迟-误差-能效指标上实现了显著提升,并通过合成知识蒸馏降低了误差。
PROOF-Gen 提出了一种每个场景的反思优化方法,用于恢复失败的轨迹以蒸馏工具调用能力,从而提升蒸馏流程中的数据质量和模型性能。
STAR-OPD是一种新颖的在线策略蒸馏方法,用于ABSA四元组提取,它使用集合结构化奖励来纠正学生模型中的结构错误,提高性能并缩小与教师模型之间的差距。
本文识别了大语言模型在监督微调后出现的事实访问失败现象,并介绍了回忆锚定蒸馏(RAD),无需标注数据即可保留分布外事实回忆能力。
本文提出意图蒸馏 (INDI),将行为意图蒸馏到视觉-语言-动作模型的动作解码器中,从而在SimplerEnv-Bridge等基准测试和现实世界任务中提高了性能。
一场向年轻经济学家介绍AI后训练的讲座,讨论了SFT、DPO等方法以及世界适应的未来挑战。
软件开发者探讨OpenAI和Anthropic将模型保持内部开发的策略可能如何影响开放权重发布,以及中国公司对模型的复现。
论文提出了TUP,一种基于排名分类的BoN式蒸馏方法,通过截断低排名的完成项并提升高排名的项,以改善对齐效率和性能。