distillation

标签

Cards List
#distillation

AlayaWorld: 交互式长视界世界建模 -- 完整技术报告

Hugging Face Daily Papers · 4天前 缓存

AlayaWorld是一个150亿参数的交互式视频世界模型,可生成24帧/秒的540p和720p视频,采用自回归潜变量块生成、受限视觉上下文以及蒸馏技术来减少推理步骤。它在长视界生成基准iWorld-Bench上达到了最先进的性能。

0 人收藏 0 人点赞
#distillation

谁怕中国模型?

Simon Willison's Blog · 4天前 缓存

Ben Thompson 提议美国立法明确将训练数据视为合理使用,并禁止通过服务条款阻止模型蒸馏。他认为这有助于美国开源模型与中国同行竞争,并指出阿里巴巴发布 Qwen 3.8 Max 可能受到习近平关于开源合作号召的影响。

0 人收藏 0 人点赞
#distillation

当困惑度误导时:面向生成的混合序列模型蒸馏

arXiv cs.CL · 5天前 缓存

本文研究了蒸馏混合序列模型中对数似然与基于生成的评估之间的差异,表明仅凭困惑度可能具有误导性。本文介绍了GenDistill,一个将Transformer蒸馏为Hybrid-KDA模型的流水线,实现了高达75%的KV缓存减少和2-4倍的首次令牌生成时间加速,同时保留了教师模型86-90%的准确率。

0 人收藏 0 人点赞
#distillation

重新思考持续学习中的迁移:一种基于回放的实现方式

arXiv cs.LG · 5天前 缓存

本文介绍了一个框架,用于判断在持续学习中何时应该期待迁移,并提出了选择性回放迁移(TSR),该机制选择预计对当前任务有益的回放数据,而非不加区分地回放过去的示例。TSR在保持稳定性的同时改善了前向迁移,优于现有的回放基线。

0 人收藏 0 人点赞
#distillation

@ethantsliu: 一些蒸馏技术:OPD: log pi - log pi_theta OPSD: log pi_theta (• | x, y*) - log pi_theta (• | x) RLSD: A(…

X AI KOLs Timeline · 6天前 缓存

此推文讨论了用于语言模型的OPD、OPSD、RLSD和OPD^2蒸馏技术,强调了使用对数概率差异来隔离训练后的改进。

0 人收藏 0 人点赞
#distillation

@jerryjliu0:我认为对于任何给定的任务,你总是可以将通用模型/智能体框架蒸馏为专用模型/智能体/工作流,以获得更高的准确性和更低的成本。

X AI KOLs Timeline · 2026-07-16 缓存

Jerry Liu 指出,对于任何任务,都可以将通用模型蒸馏为专用模型,以实现更高的准确性和更低的成本,而自动化通过定义目标和评估标准而非手动编码工作流程来实现这一过程。

0 人收藏 0 人点赞
#distillation

基于前缀重放的多轮在线策略蒸馏

Hugging Face Daily Papers · 2026-07-16 缓存

本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。

0 人收藏 0 人点赞
#distillation

RESOURCE2SKILL:从人类创建的多模态资源中提炼可执行智能体技能

Hugging Face Daily Papers · 2026-07-16 缓存

RESOURCE2SKILL是一个框架,它将教程视频、代码仓库、文章和工件等多模态资源提炼为层次化的SkillWiki中的可执行智能体技能,相比无技能智能体,将智能体性能提升了11.9个百分点。

0 人收藏 0 人点赞
#distillation

@jxmnop: 好吧,抱歉大家,显然他们确实做了蒸馏,哈哈。但只有一点点。

X AI KOLs Following · 2026-07-15 缓存

Jack Morris纠正了他早先的说法,即一个开源权重模型未经OpenAI或Anthropic蒸馏训练,承认实际上该模型确实使用了少量蒸馏。

0 人收藏 0 人点赞
#distillation

A.L.F.R.E.D.: 带模板的2B模型能以4倍更低速度匹配35B模型

Reddit r/LocalLLaMA · 2026-07-15

A.L.F.R.E.D.提出一种系统,将大模型的知识蒸馏到小模型中,并将简单任务路由给小模型,从而用2B模型实现35B模型的性能,同时将推理成本降低4倍。

0 人收藏 0 人点赞
#distillation

本体增强蒸馏与情境性审计用于主权企业语言模型:一种结合机制验证与负面结果方法的研究

arXiv cs.AI · 2026-07-15 缓存

本文结合了机制验证研究,针对主权企业语言模型的本体增强蒸馏以及一种情境性审计方法,使用了经过监督微调和DPO适配的Qwen3.6-27B学生模型。结果统计功效不足且为负面,显示未优于前沿基线,且路由中情境性为零。

0 人收藏 0 人点赞
#distillation

OvisOCR2 技术报告

Hugging Face Daily Papers · 2026-07-15 缓存

OvisOCR2 是一个0.8B参数量的端到端文档解析模型,能将文档页面图像转换为Markdown格式,通过结合监督微调、强化学习和模型融合,在公开基准上取得了最先进的分数。

0 人收藏 0 人点赞
#distillation

EasyOPD: 一种易用的面向大语言模型在策略蒸馏框架

arXiv cs.CL · 2026-07-14 缓存

EasyOPD 是一种新型的大语言模型在策略蒸馏框架,它将配置、监督逻辑和执行分离开来,并支持跨分词器、自蒸馏和逐步 OPD。

0 人收藏 0 人点赞
#distillation

MET:理论驱动与文化感知的多语言道德推理

Hugging Face Daily Papers · 2026-07-13 缓存

本文介绍了 MCLASH(一个多语言道德决策基准)、MET(一种基于理论的提示方法,用于文化感知的道德推理),以及 MET-D(一种自蒸馏训练方法,可跨不同模型家族和规模改进多语言道德推理)。

0 人收藏 0 人点赞
#distillation

为什么人们总是在经过摘要/审查的SOTA CoT轨迹上进行微调?

Reddit r/LocalLLaMA · 2026-07-12

对在已摘要或已审查的思维链推理轨迹上微调AI模型的做法提出的批评,认为此类轨迹上的蒸馏会降低模型质量,与基础模型的实际能力相比有所下降。

0 人收藏 0 人点赞
#distillation

Satya: "我发现具有讽刺意味的是,现状却是转身对蒸馏施加限制性条款"

Reddit r/ArtificialInteligence · 2026-07-12

Satya Nadella批评了对AI模型蒸馏施加限制性条款的做法,认为这具有讽刺意义,因为模型提供商本身依靠公共数据的合理使用来训练他们的模型。

0 人收藏 0 人点赞
#distillation

@anirudhg9119: 推理不一定意味着更长的思维链。PDR = 并行草稿 → 蒸馏到紧凑工作空间 → 精…

X AI KOLs Timeline · 2026-07-10 缓存

介绍了并行-蒸馏-精炼(PDR)推理方法,其中LLM并行生成草稿,将其蒸馏到紧凑的工作空间,然后精炼,以更低的延迟实现比长链思维更高的准确性。使用PDR通过RL训练的8B模型在数学基准测试中表现出显著提升。

0 人收藏 0 人点赞
#distillation

一个完全本地的模型,甚至在您的智能手机上!

Reddit r/ArtificialInteligence · 2026-07-10

发布了一个接口,用于管理两个在智能手机上本地运行的小模型(4B 和 1.7B)。4B 在高端手机上运行良好;1.7B 在推理时存在稳定性问题,正在通过深度微调进行改进,使用 130k 示例并从 32B 教师模型中进行蒸馏。

0 人收藏 0 人点赞
#distillation

不同教师,不同能力:面向结构化文本增强的Sub-1B端侧蒸馏

arXiv cs.AI · 2026-07-10 缓存

本文探索将大型推理教师模型(8B)蒸馏为小型学生模型(0.6B),用于端侧结构化文本增强,在实现大幅加速的同时恢复了显著的质量。研究发现,教师模型的推理能力而非其规模推动了摘要质量的提升,但同等规模的指令教师在某些文章上能产生更忠实的输出。

0 人收藏 0 人点赞
#distillation

@j_golebiowski: 如何使用你自己的追踪数据,直接通过 dlt,用 1.7B 模型替换 744B 智能体。四个步骤:

X AI KOLs Timeline · 2026-07-09 缓存

本推文解释如何使用 dlt 收集追踪数据,并通过四个步骤用更小的 1.7B 模型替换 744B 参数的智能体。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈