Kwai-Keye/Keye-VL-2.0-30B-A3B
摘要
Kwai-Keye 发布了 Keye-VL-2.0-30B-A3B,这是一款 30B 级别的视觉语言模型,具备先进的视频理解、稀疏注意力机制和智能体能力,在多项基准测试中达到顶尖水平。
查看缓存全文
缓存时间: 2026/06/01 14:23
Kwai-Keye/Keye-VL-2.0-30B-A3B · Hugging Face
来源:https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B
https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#keye-vl-20-30b-a3bKeye-VL-2.0-30B-A3B
Kwai Keye-VL LogoKwai Keye-VL Logo
介绍 Keye-VL-2.0-30B-A3B —— Keye 系列最新的 30B 级旗舰基础模型,专为推进长视频理解的前沿而打造,并解锁 Keye 系列第一代 Agent 能力。
https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#highlights亮点
视频基准对比
- 出色的视频理解与时间定位能力:在五项视频基准测试中,Keye-VL-2.0-30B-A3B 领先于开源竞争对手,在时间定位方面达到或超越 Gemini-3-Flash。
- DSA 原生长上下文架构:稀疏注意力与针对性特征聚合,可在保持计算高效的同时实现精确的时长理解。
- 高效推理与训练栈:DSA(DeepSeek 稀疏注意力)、ExtraIO、异构 ViT-LM 并行、激活优化和定制内核,降低了长序列预填充成本并提升了训练吞吐量。
- 以数据为中心的多模态预训练:精心策划的数据管道、Keye-VL-1.5 视觉编码器和合成 CoT 数据增强了感知、OCR/图表/表格理解和推理连续性。
- 面向可靠推理的稳健后训练:MOPD、桶优势缩放、上下文 RL 和高信噪比数据过滤,改善了跨模态专家合并,减少了幻觉,并稳定了长上下文决策。
- 支持 Agent 的多模态能力:内置代码、工具和搜索 Agent 能力,支持仓库任务、API 式工具使用、基于网络的搜索和视觉自我校正工作流。
作为首个将 DSA 投入生产的多模态模型,Keye-VL-2.0-30B-A3B 在 256K 超长上下文下实现了近乎无损的推理。在其规模下,它在视频理解基准测试中位居榜首,并在细粒度时间感知方面持续与顶级闭源模型匹敌甚至超越。更重要的是,它是首个内置 Agent 协作机制的 Keye 基础模型,在搜索、工具和代码场景中展示了坚实的系统级编排能力。
https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#model-performance-on-benchmarks模型基准性能
我们将 Keye-VL-2.0-30B-A3B 与领先的开源及闭源模型(Qwen3.5-35B-A3B、InternVL3.5-241B-A28B、GPT-5-mini、Qwen3-VL 30B-A3B / 32B / 235B-A22B)在七个能力维度上进行比较:视频、编码、Agent、数学与推理、STEM、指令遵循和通用 VQA。
性能比较 (https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B/blob/main/figures/all_metric.png)
部分亮点(完整表格见技术报告):
- 细粒度时间理解 (TimeLens):
- Charades-TimeLens: 58.4 mIoU,与我们所测试的最强闭源视频基线(Gemini 3 Flash 61.19)相当。
- ActivityNet-TimeLens: 58.5 mIoU,超越 Gemini 3 Flash (56.95)。
- QVHighlights-TimeLens: 70.1 mIoU,与官方排行榜上顶级闭源模型持平,并大幅领先 Gemini 3 Flash (49.45)。
- 长上下文扩展 (VideoMME V2):当大多数竞品随输入帧数增加而性能下降时,我们的模型准确率从 64 帧时的 35.3% 提升至 512 帧时的 42.4%;非线性推理得分从 18.5 升至 24.2。
- 全面长视频理解:
- LongVideoBench: 74.1,超越 Qwen3.5-35B-A3B 以及体量更大的 Qwen3-VL-235B-A22B,展示了 30B 规模下的强大长视频理解能力。
在 30B 规模下,Keye-VL-2.0-30B-A3B 不仅在时间理解上超越了 200B+ 参数的开源模型(如 Qwen3-VL-235B),而且在多个方面与顶级闭源巨头正面交锋甚至超越。
https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#quickstart快速开始
https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#related-repositories相关仓库
- SGLang(自定义分支):https://github.com/Kwai-Keye/sglang/tree/keye-vl-v2-30b-release
- DeepGEMM(Keye 支持):https://github.com/Kwai-Keye/DeepGEMM/tree/keye_support
- EffectiveKernels:https://github.com/Kwai-Keye/EffectiveKernels
https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#environment-setup环境设置
选项 1 —— 推荐:使用预构建 Docker 镜像
docker run -it --gpus all kwaikeye/kwai-keye-vl:keye_vl_v2_30b_a3b
选项 2 —— 从源码安装
# SGLang(自定义分支)
git clone -b keye-vl-v2-30b-release https://github.com/Kwai-Keye/sglang.git
cd sglang
pip install -e python[all]
cd ..
# DeepGEMM(Keye 支持分支)
git clone -b keye_support https://github.com/Kwai-Keye/DeepGEMM.git
cd DeepGEMM
bash install.sh
cd ..
# EffectiveKernels
git clone https://github.com/Kwai-Keye/EffectiveKernels.git
cd EffectiveKernels
pip install -e . --no-deps --no-build-isolation
cd ..
https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#minimal-launch-h800最小启动 (H800)
python3 -m sglang.launch_server \
--model-path=MODEL_NAME \
--tp-size=2 \
--trust-remote-code \
--mem-fraction-static=0.8
这是一个标准的 SGLang 服务 —— 使用任何兼容 OpenAI 的客户端调用即可。
https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#client-usage客户端使用
以下是针对图像和视频输入的 SGLang 推理脚本示例。
所有采样参数(如 temperature、top_k 等)仅用于演示,不应视为推荐设置。用户应自行尝试并根据需要调整这些参数。
视频帧采样相关参数也可按需自定义。具体来说,min_pixels 和 max_pixels 可用于设置每帧的 Token 下限和上限,而 video_total_pixels 可用于限制整个视频输入的总 Token 预算。
如果未指定 fps,默认值为 2.0。
https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#image-input图像输入
import json
import requests
BASE_URL = "http://MASTER_NODE_IP:8000"
def generate(messages):
payload = {
"model": "",
"messages": messages,
"n": 1,
"temperature": 0.0,
"max_tokens": 256,
"top_k": 1,
"ignore_eos": False,
"skip_special_tokens": True,
}
resp = requests.post(
f"{BASE_URL}/v1/chat/completions",
headers={"Content-Type": "application/json"},
data=json.dumps(payload),
timeout=1800,
)
resp.raise_for_status()
return resp.json()
# 示例:图像 + 文本
messages = [
{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {"url": "https://raw.githubusercontent.com/sgl-project/sglang/main/assets/logo.png"},
},
{"type": "text", "text": "Describe this image in detail."},
],
}
]
result = generate(messages)
print(result["choices"][0]["message"]["content"])
https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#video-input视频输入
import json
import requests
BASE_URL = "http://MASTER_NODE_IP:8000"
def generate(messages):
payload = {
"model": "",
"messages": messages,
"n": 1,
"temperature": 0.1,
"max_tokens": 32760,
"top_p": 0.001,
"ignore_eos": False,
"skip_special_tokens": True,
}
resp = requests.post(
f"{BASE_URL}/v1/chat/completions",
headers={"Content-Type": "application/json"},
data=json.dumps(payload),
timeout=1800,
)
resp.raise_for_status()
return resp.json()
# 示例:视频 + 文本
messages = [
{
"role": "user",
"content": [
{
"type": "video_url",
"video_url": {
"url": video_url,
"preprocess_kwargs": {
"fps": 2.0,
"min_pixels": 128*28*28,
"max_pixels": 512*28*28,
"video_total_pixels":180*1024*28*28,
}
},
},
{"type": "text", "text": "Describe this video."},
],
},
]
result = generate(messages)
print(result["choices"][0]["message"]["content"])
相似文章
Keye-VL-2.0-30B-A3B —— 首次将DSA注意力引入多模态
快手发布Keye-VL-2.0-30B-A3B,这是一款30B级多模态基础模型,首次将DSA注意力引入多模态领域,专注于长视频理解与智能体能力。
@AdinaYakup: Keye VL 2.0-30B-A3B 来自 @KwaiKeye 的新多模态模型 30B/3B 激活 - Apache 2.0 通过 DeepSeek Sparse Att… 提供 256K 上下文
KwaiKeye 发布 Keye VL 2.0-30B-A3B,这是一个多模态模型,拥有 30B 总参数/3B 激活参数,通过 DeepSeek Sparse Attention 提供 256K 上下文,采用 Apache 2.0 许可证,声称其准确性可与 Qwen3 VL 和 Gemini 3 媲美。
Kwai Keye-VL-2.0 技术报告
本技术报告介绍了 Kwai Keye-VL-2.0,这是一个开源的混合专家多模态基础模型,专为长视频理解和智能体智能设计,利用 DeepSeek 稀疏注意力机制和跨模态蒸馏技术,在同等规模模型中实现了最先进的性能。
Kimi K3: 开放前沿智能
Kimi 推出 Kimi K3,一个拥有 2.8 万亿参数的开放模型,具备原生视觉和 100 万上下文能力,基于 Kimi Delta Attention 和 Attention Residuals 构建。它在编码与推理方面达到前沿性能水平,完整权重将于 2026 年 7 月前发布。
LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge
LiquidAI announces LFM2.5-VL-3B, an efficient vision-language model for edge hardware with improved screen understanding, grounding, multi-image input, and function calling, trained with 4x more vision data and post-training via SFT and RL.