Kwai Keye-VL-2.0 技术报告

Hugging Face Daily Papers 论文

摘要

本技术报告介绍了 Kwai Keye-VL-2.0,这是一个开源的混合专家多模态基础模型,专为长视频理解和智能体智能设计,利用 DeepSeek 稀疏注意力机制和跨模态蒸馏技术,在同等规模模型中实现了最先进的性能。

我们介绍了 Kwai Keye-VL-2.0-30B-A3B,这是一个开源的混合专家(MoE)多模态基础模型,旨在推进长视频理解和智能体智能。为了解决超长上下文、信息冗余以及小时级视频固有的高昂计算成本等挑战,Keye-VL-2.0 首次将 DeepSeek 稀疏注意力(DSA)适配到基于 GQA 的多模态架构中,实现了无损的 256K 上下文处理,同时捕捉关键帧和长期时间依赖。该架构依托于高度优化的训练和推理基础设施,包括可扩展的视频 I/O、异构 ViT-LM 并行以及定制的 DSA 内核,显著提升了吞吐量并最小化了计算开销。此外,为了克服多任务对齐过程中灾难性遗忘的算法难题,我们引入了跨模态多教师在线策略蒸馏(MOPD)与 Context-RL 和 Video-RL 相结合。通过将来自在线策略 rollout 的密集令牌级教师反馈蒸馏回仅激活 3B 参数的 MoE 主干网络,Keye-VL-2.0 原生地支持了代码、工具和搜索场景中具有多模态自我纠正的高级智能体协作。在视频理解、时间定位、推理、STEM 和智能体基准上的广泛评估表明,Kwai Keye-VL-2.0-30B-A3B 在同等规模模型中达到了最先进的性能,特别是在 TimeLens 上的细粒度时间定位以及 Video-MME-v2 和 LongVideoBench 上的长视频理解方面表现出色。我们发布了模型检查点,以加速社区向可扩展且鲁棒的多模态智能体应用迈进。
查看原文
查看缓存全文

缓存时间: 2026/06/10 09:43

论文页面 - Kwai Keye-VL-2.0 技术报告

来源:https://huggingface.co/papers/2606.10651 发布于 6 月 9 日

当日排名 #2 的论文 (https://huggingface.co/papers/date/2026-06-10) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

Kwai Keye-VL-2.0-30B-A3B 是一个开源混合专家多模态基础模型,通过 DeepSeek 稀疏注意力机制和专用训练基础设施,实现了长视频理解与智能体智能。

我们介绍 Kwai Keye-VL-2.0-30B-A3B,这是一个开源的混合专家 (https://huggingface.co/papers?q=Mixture-of-Experts) (MoE) 多模态基础模型 (https://huggingface.co/papers?q=multimodal%20foundation%20model),旨在推进长视频理解与智能体智能。为应对小时级视频中存在的超长上下文、信息冗余和过高计算成本等挑战,Keye-VL-2.0 首次将 DeepSeek 稀疏注意力 (https://huggingface.co/papers?q=DeepSeek%20Sparse%20Attention) (DSA) 适配到基于 GQA 的多模态架构中,实现了无损的 256K 上下文处理 (https://huggingface.co/papers?q=256K%20context%20processing),同时捕获关键帧和长程时间依赖关系。该架构由高度优化的训练和推理基础设施支撑,包括可扩展的视频 I/O、异构 ViT-LM 并行 (https://huggingface.co/papers?q=heterogeneous%20ViT-LM%20parallelism) 以及定制 DSA 内核 (https://huggingface.co/papers?q=custom%20DSA%20kernels),显著提高了吞吐量并降低了计算开销。此外,为解决多任务对齐过程中灾难性遗忘的算法难题,我们引入了跨模态多教师在线策略蒸馏 (https://huggingface.co/papers?q=Cross-Modal%20Multi-Teacher%20On-Policy%20Distillation) (MOPD),并结合上下文强化学习 (https://huggingface.co/papers?q=Context-RL) 和视频强化学习 (https://huggingface.co/papers?q=Video-RL)。通过将从在线策略推演 (https://huggingface.co/papers?q=on-policy%20rollouts) 中获得的密集 token 级教师反馈 (https://huggingface.co/papers?q=dense%20token-level%20teacher%20feedback) 蒸馏回仅激活 3B 参数的 MoE 主干,Keye-VL-2.0 原生实现了在代码 (https://huggingface.co/papers?q=Code)、工具 (https://huggingface.co/papers?q=Tool) 和搜索场景 (https://huggingface.co/papers?q=Search%20scenarios) 中的高级智能体协作 (https://huggingface.co/papers?q=agent%20collaboration),并具备多模态自我修正 (https://huggingface.co/papers?q=multimodal%20self-correction) 能力。在视频理解、时间定位、推理、STEM 和智能体基准测试上的广泛评估表明,Keye-VL-2.0-30B-A3B 在相似规模的模型中达到了最先进的性能,尤其在 TimeLens 上的细粒度时间定位以及 Video-MME-v2 和 LongVideoBench 上的长视频理解方面表现卓越。我们已发布模型检查点,以加速社区向可扩展且鲁棒的多模态智能体应用迈进。

查看 arXiv 页面 (https://arxiv.org/abs/2606.10651) 查看 PDF (https://arxiv.org/pdf/2606.10651) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.10651)

在你的智能体中获取此论文:

hf papers read 2606.10651

没有最新的 CLI?curl \-LsSf https://hf.co/cli/install.sh \| bash

引用此论文的模型1

Kwai-Keye/Keye-VL-2.0-30B-A3B 图像文本到文本 • 31B • 更新于约5小时前 • 3.25k • 109 (https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B)

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2606.10651 即可从此页面链接。

引用此论文的 Spaces1

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

Kwai-Keye/Keye-VL-2.0-30B-A3B

Hugging Face Models Trending

Kwai-Keye 发布了 Keye-VL-2.0-30B-A3B,这是一款 30B 级别的视觉语言模型,具备先进的视频理解、稀疏注意力机制和智能体能力,在多项基准测试中达到顶尖水平。

Kimi K3: 开放前沿智能

Hugging Face Daily Papers

Kimi K3 是一个2.8万亿参数的混合专家模型,具有1040亿活跃参数、原生视觉能力和100万token的上下文窗口,在多个领域达到前沿性能,并以开放权重形式发布。

VideoChat3: 完全开源的高效且通用的视频理解MLLM

Papers with Code Trending

VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。