Kwai-Keye/Keye-VL-2.0-30B-A3B

Hugging Face Models Trending 模型

摘要

Kwai-Keye 发布了 Keye-VL-2.0-30B-A3B,这是一款 30B 级别的视觉语言模型,具备先进的视频理解、稀疏注意力机制和智能体能力,在多项基准测试中达到顶尖水平。

任务: image-text-to-text 标签: transformers, safetensors, KeyeVL2, feature-extraction, multimodal, image-text-to-text, conversational, custom_code, en, license:apache-2.0, eval-results, region:us
查看原文
查看缓存全文

缓存时间: 2026/06/01 14:23

Kwai-Keye/Keye-VL-2.0-30B-A3B · Hugging Face

来源:https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B

https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#keye-vl-20-30b-a3bKeye-VL-2.0-30B-A3B

Kwai Keye-VL LogoKwai Keye-VL Logo

介绍 Keye-VL-2.0-30B-A3B —— Keye 系列最新的 30B 级旗舰基础模型,专为推进长视频理解的前沿而打造,并解锁 Keye 系列第一代 Agent 能力。

https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#highlights亮点

视频基准对比

  • 出色的视频理解与时间定位能力:在五项视频基准测试中,Keye-VL-2.0-30B-A3B 领先于开源竞争对手,在时间定位方面达到或超越 Gemini-3-Flash。
  • DSA 原生长上下文架构:稀疏注意力与针对性特征聚合,可在保持计算高效的同时实现精确的时长理解。
  • 高效推理与训练栈:DSA(DeepSeek 稀疏注意力)、ExtraIO、异构 ViT-LM 并行、激活优化和定制内核,降低了长序列预填充成本并提升了训练吞吐量。
  • 以数据为中心的多模态预训练:精心策划的数据管道、Keye-VL-1.5 视觉编码器和合成 CoT 数据增强了感知、OCR/图表/表格理解和推理连续性。
  • 面向可靠推理的稳健后训练:MOPD、桶优势缩放、上下文 RL 和高信噪比数据过滤,改善了跨模态专家合并,减少了幻觉,并稳定了长上下文决策。
  • 支持 Agent 的多模态能力:内置代码、工具和搜索 Agent 能力,支持仓库任务、API 式工具使用、基于网络的搜索和视觉自我校正工作流。

作为首个将 DSA 投入生产的多模态模型,Keye-VL-2.0-30B-A3B 在 256K 超长上下文下实现了近乎无损的推理。在其规模下,它在视频理解基准测试中位居榜首,并在细粒度时间感知方面持续与顶级闭源模型匹敌甚至超越。更重要的是,它是首个内置 Agent 协作机制的 Keye 基础模型,在搜索、工具和代码场景中展示了坚实的系统级编排能力。

https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#model-performance-on-benchmarks模型基准性能

我们将 Keye-VL-2.0-30B-A3B 与领先的开源及闭源模型(Qwen3.5-35B-A3B、InternVL3.5-241B-A28B、GPT-5-mini、Qwen3-VL 30B-A3B / 32B / 235B-A22B)在七个能力维度上进行比较:视频、编码、Agent、数学与推理、STEM、指令遵循和通用 VQA。

性能比较 (https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B/blob/main/figures/all_metric.png)

部分亮点(完整表格见技术报告):

  • 细粒度时间理解 (TimeLens):
    • Charades-TimeLens: 58.4 mIoU,与我们所测试的最强闭源视频基线(Gemini 3 Flash 61.19)相当。
    • ActivityNet-TimeLens: 58.5 mIoU,超越 Gemini 3 Flash (56.95)。
    • QVHighlights-TimeLens: 70.1 mIoU,与官方排行榜上顶级闭源模型持平,并大幅领先 Gemini 3 Flash (49.45)。
  • 长上下文扩展 (VideoMME V2):当大多数竞品随输入帧数增加而性能下降时,我们的模型准确率从 64 帧时的 35.3% 提升至 512 帧时的 42.4%;非线性推理得分从 18.5 升至 24.2。
  • 全面长视频理解:
    • LongVideoBench: 74.1,超越 Qwen3.5-35B-A3B 以及体量更大的 Qwen3-VL-235B-A22B,展示了 30B 规模下的强大长视频理解能力。

在 30B 规模下,Keye-VL-2.0-30B-A3B 不仅在时间理解上超越了 200B+ 参数的开源模型(如 Qwen3-VL-235B),而且在多个方面与顶级闭源巨头正面交锋甚至超越。

https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#quickstart快速开始

https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#related-repositories相关仓库

  • SGLang(自定义分支):https://github.com/Kwai-Keye/sglang/tree/keye-vl-v2-30b-release
  • DeepGEMM(Keye 支持):https://github.com/Kwai-Keye/DeepGEMM/tree/keye_support
  • EffectiveKernels:https://github.com/Kwai-Keye/EffectiveKernels

https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#environment-setup环境设置

选项 1 —— 推荐:使用预构建 Docker 镜像

docker run -it --gpus all kwaikeye/kwai-keye-vl:keye_vl_v2_30b_a3b

选项 2 —— 从源码安装

# SGLang(自定义分支)
git clone -b keye-vl-v2-30b-release https://github.com/Kwai-Keye/sglang.git
cd sglang
pip install -e python[all]
cd ..

# DeepGEMM(Keye 支持分支)
git clone -b keye_support https://github.com/Kwai-Keye/DeepGEMM.git
cd DeepGEMM
bash install.sh
cd ..

# EffectiveKernels
git clone https://github.com/Kwai-Keye/EffectiveKernels.git
cd EffectiveKernels
pip install -e . --no-deps --no-build-isolation
cd ..

https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#minimal-launch-h800最小启动 (H800)

python3 -m sglang.launch_server \
    --model-path=MODEL_NAME \
    --tp-size=2 \
    --trust-remote-code \
    --mem-fraction-static=0.8

这是一个标准的 SGLang 服务 —— 使用任何兼容 OpenAI 的客户端调用即可。

https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#client-usage客户端使用

以下是针对图像和视频输入的 SGLang 推理脚本示例。

所有采样参数(如 temperaturetop_k 等)仅用于演示,不应视为推荐设置。用户应自行尝试并根据需要调整这些参数。

视频帧采样相关参数也可按需自定义。具体来说,min_pixelsmax_pixels 可用于设置每帧的 Token 下限和上限,而 video_total_pixels 可用于限制整个视频输入的总 Token 预算。

如果未指定 fps,默认值为 2.0

https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#image-input图像输入

import json
import requests

BASE_URL = "http://MASTER_NODE_IP:8000"

def generate(messages):
    payload = {
        "model": "",
        "messages": messages,
        "n": 1,
        "temperature": 0.0,
        "max_tokens": 256,
        "top_k": 1,
        "ignore_eos": False,
        "skip_special_tokens": True,
    }
    resp = requests.post(
        f"{BASE_URL}/v1/chat/completions",
        headers={"Content-Type": "application/json"},
        data=json.dumps(payload),
        timeout=1800,
    )
    resp.raise_for_status()
    return resp.json()

# 示例:图像 + 文本
messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "image_url",
                "image_url": {"url": "https://raw.githubusercontent.com/sgl-project/sglang/main/assets/logo.png"},
            },
            {"type": "text", "text": "Describe this image in detail."},
        ],
    }
]

result = generate(messages)
print(result["choices"][0]["message"]["content"])

https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B#video-input视频输入

import json
import requests

BASE_URL = "http://MASTER_NODE_IP:8000"

def generate(messages):
    payload = {
        "model": "",
        "messages": messages,
        "n": 1,
        "temperature": 0.1,
        "max_tokens": 32760,
        "top_p": 0.001,
        "ignore_eos": False,
        "skip_special_tokens": True,
    }
    resp = requests.post(
        f"{BASE_URL}/v1/chat/completions",
        headers={"Content-Type": "application/json"},
        data=json.dumps(payload),
        timeout=1800,
    )
    resp.raise_for_status()
    return resp.json()

# 示例:视频 + 文本
messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "video_url",
                "video_url": {
                    "url": video_url,
                    "preprocess_kwargs": {
                        "fps": 2.0,
                        "min_pixels": 128*28*28,
                        "max_pixels": 512*28*28,
                        "video_total_pixels":180*1024*28*28,
                    }     
                },          
            },
            {"type": "text", "text": "Describe this video."},
        ],
    },
]

result = generate(messages)
print(result["choices"][0]["message"]["content"])

相似文章

Kwai Keye-VL-2.0 技术报告

Hugging Face Daily Papers

本技术报告介绍了 Kwai Keye-VL-2.0,这是一个开源的混合专家多模态基础模型,专为长视频理解和智能体智能设计,利用 DeepSeek 稀疏注意力机制和跨模态蒸馏技术,在同等规模模型中实现了最先进的性能。

Kimi K3: 开放前沿智能

Reddit r/LocalLLaMA

Kimi 推出 Kimi K3,一个拥有 2.8 万亿参数的开放模型,具备原生视觉和 100 万上下文能力,基于 Kimi Delta Attention 和 Attention Residuals 构建。它在编码与推理方面达到前沿性能水平,完整权重将于 2026 年 7 月前发布。