@MiaAI_lab: Cloudflare 的 Clef 仅用两周就超越了 Jev 方法:"冻结"的 Qwen 只做一次 prefill,一个极小的 schema head 对每个……

X AI KOLs Timeline 模型

摘要

Cloudflare 发布了 Clef,这是一个开源的 27B 多模态决策模型,采用冻结的 Qwen 主干网络和一个极轻量的 schema 头部,在单次前向传播中对所有答案选项进行打分,无需文本生成,速度可达 Jev 的 4 倍,准确率最高可达其 2 倍。体积更小、速度更快的变体 Clef-Flash 也已在 Hugging Face 上发布。

Cloudflare 的 Clef 仅用两周就超越了 Jev 原理:"冻结"的 Qwen 只做一次前缀填充(prefill),一个极小的 schema 头会并行地为每个答案选项打分,完全不生成任何文本。 这就是为什么在某些基准测试中,它的速度是 Jev 的 4 倍,而准确率却是其 2 倍。 而且它是开源的! HF 链接: https://huggingface.co/Cloudflare/clef
查看原文
查看缓存全文

缓存时间: 2026/10/03 04:53

Cloudflare 的 Clef 只用两周就超越了 Jev

原理:“冻结“的 Qwen 只做一次预填充(prefill),一个很小的 schema head 并行为每个答案选项打分,全程不生成任何文本。

所以在某些基准测试上,它比 Jev 快 4 倍,同时精度高出 2 倍。

而且它是开源的!

HF 链接: https://huggingface.co/Cloudflare/clef


Cloudflare/clef · Hugging Face

来源:https://huggingface.co/Cloudflare/clef

  • **公告:**Cloudflare 博客上的 Clef 决策模型(https://blog.cloudflare.com/clef-decision-models)
  • **Decision Index 排行榜:**clef-evals.workers-ai-mle.workers.dev(https://clef-evals.workers-ai-mle.workers.dev/)

Clef 是一个 27B 多模态模型,能够将状态和一组带类型的 schema 问题转化为决策。它可以以文本、JSON、图像或视频的形式读取状态,并在单次前向传播中为每个问题的每个允许选项返回一个概率。它不做自由文本生成,也不需要输出解析。

Clef 的 API 与 Jev 和 SystemOne 完全兼容。

Clef 是在 Qwen/Qwen3.8-27B(https://huggingface.co/Qwen/Qwen3.8-27B)基础上进行后训练得到的。更小、更快的变体请参见 Clef-Flash(https://huggingface.co/Cloudflare/clef-flash)。

https://huggingface.co/Cloudflare/clef#model模型

  • **骨干网络:**Qwen/Qwen3.8-27B 及其视觉编码器,以标准的分片 safetensors 格式存储。
  • **联合 schema head:**一个很小的 transformer 头,读取骨干网络的最终隐藏层状态,将来自状态的证据路由到每个问题,并联合为所有问题的所有选项打分。
  • **输出:**每个问题的每个允许选项对应一个 logit。对每个问题分别施加 softmax 即可得到概率。

https://huggingface.co/Cloudflare/clef#files文件

文件用途
model-*.safetensors、model.safetensors.index.json、config.json、generation_config.json骨干网络,包括视觉编码器
joint_head.safetensors、joint_head_config.json联合 schema head
joint_schema_model.py记录编码、批处理、模型、load_release_model 以及 systemone
tokenizer.json、tokenizer_config.json、chat_template.jinja、processor_config.jsontokenizer 以及图像/视频处理器
LICENSEApache-2.0 许可证

https://huggingface.co/Cloudflare/clef#usage用法

在单张 H200 上,使用 torch 2.11 和 transformers 5.10.2 进行了测试。使用图像和视频输入还需要 pillow。

import sys

import torch
from huggingface_hub import snapshot_download

path = snapshot_download("Cloudflare/clef")
sys.path.insert(0, path)
from joint_schema_model import collate_records, encode_record, load_release_model

model, processor = load_release_model(path, device="cuda")

record = {
    "state": {"invoice": {"vendor": "Acme", "total": 1250.0, "currency": "USD", "status": "overdue"}},
    "questions": {
        "status": {
            "type": "choice",
            "instructions": "What is the invoice status?",
            "criteria": {"paid": "Invoice is paid.", "overdue": "Invoice is past due.", "draft": "Not sent."},
        },
        "large": {"type": "noul", "instructions": "Is the total above 1000 USD?"},
    },
}

encoded = encode_record(processor.tokenizer, record, processor=processor)
batch = collate_records([encoded], processor.tokenizer.pad_token_id, torch.device("cuda"))
with torch.inference_mode():
    logits = model(batch)[0]

for question, question_logits in zip(encoded.questions, logits):
    probabilities = question_logits.float().softmax(-1).tolist()
    print(question.question_id, dict(zip(question.option_ids, probabilities)))

https://huggingface.co/Cloudflare/clef#jev–systemone-apiJev / SystemOne API

systemone 接受一个 Jev/SystemOne 的 POST /v1/systemone 请求体,并返回相同的响应体:model、按问题 ID 索引的 answers,以及 usage。choice 类型的答案包含 choice、confidence 和 probabilities;score 类型的答案包含预期的 score、confidence、legend 和 probabilities;noul 类型的答案则给出为真的概率。instructions 是可选的,请求中还可以添加 images 和 videos。

from joint_schema_model import systemone

response = systemone(model, processor, {
    "model": "clef",
    "state": "Our checkout started returning errors and orders are blocked.",
    "questions": {
        "department": {
            "type": "choice",
            "instructions": "Which team should handle the message?",
            "criteria": {"billing": "Payments or invoices", "technical": "Bugs or outages"},
        },
        "urgency": {"type": "score", "criteria": ["Can wait", "This week", "Today"]},
        "outage": {"type": "noul", "instructions": "Is a service down?"},
    },
})
print(response["answers"])

https://huggingface.co/Cloudflare/clef#images-and-video图像与视频

在记录中添加 images(PIL 图像)或 videos(帧数组),并将 processor 传给 encode_record。可选的 processor 参数放在 media_kwargs 中。

from PIL import Image

record = {
    "state": {"task": "Review the attached receipt."},
    "images": [Image.open("receipt.jpg")],
    "questions": {
        "legible": {"type": "noul", "instructions": "Is the receipt total legible?"},
    },
}
encoded = encode_record(processor.tokenizer, record, processor=processor)

纯文本记录和多模态记录可以在同一个批次中混合使用。

https://huggingface.co/Cloudflare/clef#input-format输入格式

字段描述
state描述待决策情形的任意字符串或 JSON 值
images、videos可选的图像或视频帧数组列表
media_kwargs可选的图像/视频处理器关键字参数
questions问题 ID 到问题的映射

每个问题包含:

  • type:noul(真/假)、choice(命名选项)或 score(有序选项)
  • instructions:要决策的内容;可选,省略时使用问题 ID 代替
  • criteria:对于 choice,是选项 ID 到描述的映射;对于 score,是从 0 开始索引的选项描述列表;对于 noul,可选的 true 和 false 描述

encode_record 接受 max_length(默认 16,384 个 token)和 max_state_tokens 参数,用于限制输入长度。

https://huggingface.co/Cloudflare/clef#results结果

https://huggingface.co/Cloudflare/clef#decision-indexDecision Index

以下是我们内部运行 Decision Index(https://clef-evals.workers-ai-mle.workers.dev/)0.2.1 套件得到的各基准测试结果。分数以百分比表示;ForecastBench 采用 Brier 分数,数值越低越好。最后两行是请求延迟(毫秒),数值越低越好。每行中的最优值以粗体标出。

基准测试ClefClef-flashJevDiffusionGemma JevKev 9BLaya
BFCL(完全匹配准确率)98.598.895.896.594.538.1
ToolRet(nDCG@10)69.266.465.361.264.312.8
API-Bank(准确率)91.993.188.283.756.311.5
BANKING77(macro-F1)94.290.979.774.384.814.3
CLINC150+OOS(macro-F1)97.466.889.383.579.03.2
RouterBench(选择质量)79.779.979.979.080.057.1
家电模拟器(完全匹配准确率)83.097.752.342.025.00.0
SGD/SGD-X(macro-F1)43.834.243.040.664.042.4
ContractNLI(macro-F1)81.484.371.776.057.829.0
ANLI(macro-F1)69.859.174.866.456.348.7
BPoMP(准确率)96.995.490.686.967.051.6
Humicroedit(准确率)66.775.161.963.055.847.2
POP909-CL(准确率)15.81.618.12.510.85.1
cfcolor(准确率)66.065.864.758.256.352.3
MMLU(准确率)90.391.891.779.375.330.7
GPQA Diamond(准确率)48.051.078.344.938.827.6
ARC-Easy(准确率)99.099.599.398.297.747.0
ARC-Challenge(准确率)97.798.397.894.593.728.6
WinoGrande(准确率)93.597.592.073.673.250.5
HellaSwag(准确率)98.298.694.583.381.933.1
GSM8K(准确率)80.867.379.950.348.721.6
ChessBench(准确率)24.723.017.214.211.27.7
MuSR(准确率)83.586.066.161.257.943.2
SATA-Bench(完全匹配准确率)33.836.726.427.526.70.3
BRIGHT(nDCG@10)45.939.347.542.938.519.9
Amazon ESCI(macro-F1)57.557.455.253.449.224.4
ACOS(每条评价 F1)33.325.929.524.518.33.5
FinEntity(macro-F1)96.297.187.089.088.461.0
VAST(macro-F1)59.549.664.655.755.440.5
NLI4CT(macro-F1)82.978.684.178.474.947.7
CRUXEval(准确率)86.786.173.064.751.240.2
CLadder(准确率)94.097.772.667.862.052.9
ForecastBench(Brier,越低越好)13.910.617.429.617.641.1
Habermas Machine(准确率)68.771.845.945.039.433.4
PhishNChips(准确率)79.675.062.585.450.750.1
MMLU-Pro(准确率)65.965.382.756.951.113.6
BBH(准确率)73.768.992.970.765.234.1
RAGTruth(幻觉 F1)79.435.676.570.446.248.8
HoVer(准确率)65.261.272.970.958.855.8
When2Call MCQ(准确率)72.465.681.075.449.611.9
New Yorker(准确率)69.566.170.163.658.127.1
中位延迟(ms)209.338.8524.184.451.45.8
p95 延迟(ms)238.6122.4536.0211.2187.9222.5

https://huggingface.co/Cloudflare/clef#workflow-evals工作流评测

来自 Typesafe Evals(https://evals.typesafe.ai/)的四个端到端业务工作流上的决策准确率,以共识参考标签进行评分。所有模型均在相同的数据集版本和案例集上评分。

工作流指标ClefClef-flashJev
发票处理精确动作64.757.161.8
发票处理主要动作86.273.383.1
客户服务精确动作76.377.076.0
安全事件精确动作62.961.761.7
Agent 轨迹可观测性主要动作68.569.871.6

https://huggingface.co/Cloudflare/clef#license许可证

基于基础模型 Qwen/Qwen3.8-27B(https://huggingface.co/Qwen/Qwen3.8-27B),采用 Apache-2.0 许可证发布。

相似文章

@victormustar: 提醒:Cloudflare 刚刚在 Hugging Face 上发布了 Jev 的替代方案(Apache 2.0)

X AI KOLs Timeline

Cloudflare 在 Hugging Face 上发布了 Clef,一个开源(Apache 2.0)的 27B 多模态决策模型。它能将一个状态和一份带类型的问题 schema 转化为所有选项的概率,且只需一次前向传播即可完成。Clef 基于 Qwen3.8-27B 后训练而来,不支持自由文本生成,并且与 Jev 和 SystemOne 的 API 兼容,另有一个更小的 Clef-Flash 变体可供选择。

Cloudflare/clef-flash

Hugging Face Models Trending

Cloudflare 发布了 Clef-Flash,这是一个基于 Qwen3.5-9B 构建的 9B 多模态决策模型,能够在单次前向传播中将一个状态和一组带类型问题的 schema 转换为各选项的概率,无需自由文本生成或输出解析。

Clef:Cloudflare 发布的开放权重决策模型

Reddit r/LocalLLaMA

Cloudflare 发布了 Clef,这是一个开放权重的 27B 多模态决策模型。它以一个状态和一组带类型的结构化问题作为输入,通过一次前向传播直接输出每个选项的概率,无需自由文本生成,也无需解析输出。该模型在 Qwen3.8-27B 基础上进行后训练,已发布于 Hugging Face,并提供更小的 Clef-Flash 变体,同时兼容 Jev/SystemOne API。

Clef

Product Hunt

Cloudflare 推出 Clef 和 Clef-flash,这两款开源决策模型托管于 Workers AI,可实现高速分类和智能体工作流;同时还发布了新的强化学习平台,让开发者使用自己的数据对决策模型进行微调。

Clef:我们的开源决策模型

Hacker News Top

Cloudflare 发布了两个开源决策模型 Clef 和 Clef-flash,托管于 Workers AI,采用 Apache 2.0 许可并在 Hugging Face 上开放下载,主打低成本、快速且一致的结构化输出,目前在 Jev Decision Index 榜单领先;同时推出新的强化学习微调平台,支持客户针对自身用例对 Clef 进行微调。