标签
AlayaWorld是一个150亿参数的交互式视频世界模型,可生成24帧/秒的540p和720p视频,采用自回归潜变量块生成、受限视觉上下文以及蒸馏技术来减少推理步骤。它在长视界生成基准iWorld-Bench上达到了最先进的性能。
Ben Thompson 提议美国立法明确将训练数据视为合理使用,并禁止通过服务条款阻止模型蒸馏。他认为这有助于美国开源模型与中国同行竞争,并指出阿里巴巴发布 Qwen 3.8 Max 可能受到习近平关于开源合作号召的影响。
本文研究了蒸馏混合序列模型中对数似然与基于生成的评估之间的差异,表明仅凭困惑度可能具有误导性。本文介绍了GenDistill,一个将Transformer蒸馏为Hybrid-KDA模型的流水线,实现了高达75%的KV缓存减少和2-4倍的首次令牌生成时间加速,同时保留了教师模型86-90%的准确率。
本文介绍了一个框架,用于判断在持续学习中何时应该期待迁移,并提出了选择性回放迁移(TSR),该机制选择预计对当前任务有益的回放数据,而非不加区分地回放过去的示例。TSR在保持稳定性的同时改善了前向迁移,优于现有的回放基线。
此推文讨论了用于语言模型的OPD、OPSD、RLSD和OPD^2蒸馏技术,强调了使用对数概率差异来隔离训练后的改进。
Jerry Liu 指出,对于任何任务,都可以将通用模型蒸馏为专用模型,以实现更高的准确性和更低的成本,而自动化通过定义目标和评估标准而非手动编码工作流程来实现这一过程。
本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。
RESOURCE2SKILL是一个框架,它将教程视频、代码仓库、文章和工件等多模态资源提炼为层次化的SkillWiki中的可执行智能体技能,相比无技能智能体,将智能体性能提升了11.9个百分点。
Jack Morris纠正了他早先的说法,即一个开源权重模型未经OpenAI或Anthropic蒸馏训练,承认实际上该模型确实使用了少量蒸馏。
A.L.F.R.E.D.提出一种系统,将大模型的知识蒸馏到小模型中,并将简单任务路由给小模型,从而用2B模型实现35B模型的性能,同时将推理成本降低4倍。
本文结合了机制验证研究,针对主权企业语言模型的本体增强蒸馏以及一种情境性审计方法,使用了经过监督微调和DPO适配的Qwen3.6-27B学生模型。结果统计功效不足且为负面,显示未优于前沿基线,且路由中情境性为零。
OvisOCR2 是一个0.8B参数量的端到端文档解析模型,能将文档页面图像转换为Markdown格式,通过结合监督微调、强化学习和模型融合,在公开基准上取得了最先进的分数。
EasyOPD 是一种新型的大语言模型在策略蒸馏框架,它将配置、监督逻辑和执行分离开来,并支持跨分词器、自蒸馏和逐步 OPD。
本文介绍了 MCLASH(一个多语言道德决策基准)、MET(一种基于理论的提示方法,用于文化感知的道德推理),以及 MET-D(一种自蒸馏训练方法,可跨不同模型家族和规模改进多语言道德推理)。
对在已摘要或已审查的思维链推理轨迹上微调AI模型的做法提出的批评,认为此类轨迹上的蒸馏会降低模型质量,与基础模型的实际能力相比有所下降。
Satya Nadella批评了对AI模型蒸馏施加限制性条款的做法,认为这具有讽刺意义,因为模型提供商本身依靠公共数据的合理使用来训练他们的模型。
介绍了并行-蒸馏-精炼(PDR)推理方法,其中LLM并行生成草稿,将其蒸馏到紧凑的工作空间,然后精炼,以更低的延迟实现比长链思维更高的准确性。使用PDR通过RL训练的8B模型在数学基准测试中表现出显著提升。
发布了一个接口,用于管理两个在智能手机上本地运行的小模型(4B 和 1.7B)。4B 在高端手机上运行良好;1.7B 在推理时存在稳定性问题,正在通过深度微调进行改进,使用 130k 示例并从 32B 教师模型中进行蒸馏。
本文探索将大型推理教师模型(8B)蒸馏为小型学生模型(0.6B),用于端侧结构化文本增强,在实现大幅加速的同时恢复了显著的质量。研究发现,教师模型的推理能力而非其规模推动了摘要质量的提升,但同等规模的指令教师在某些文章上能产生更忠实的输出。
本推文解释如何使用 dlt 收集追踪数据,并通过四个步骤用更小的 1.7B 模型替换 744B 参数的智能体。