Clef:我们的开源决策模型

Hacker News Top 模型

摘要

Cloudflare 发布了两个开源决策模型 Clef 和 Clef-flash,托管于 Workers AI,采用 Apache 2.0 许可并在 Hugging Face 上开放下载,主打低成本、快速且一致的结构化输出,目前在 Jev Decision Index 榜单领先;同时推出新的强化学习微调平台,支持客户针对自身用例对 Clef 进行微调。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/10/01 17:11

# 推出 Clef:我们的开源决策模型,以及全新的 RL 微调平台 来源:https://blog.cloudflare.com/clef-decision-models/ 最近几周,围绕决策模型(decision models)的讨论热度持续攀升,例如 Typesafe AI 的 Jev(https://typesafe.ai/blog/introducing-system-one-models-and-jev)System One 模型。分类器模型(classifier models)已经存在了一段时间,但 Jev 为 AI 领域引入了一种新的决策模型概念——一种能够以低成本、快速且稳定地产生受限的结构化输出的模型,可在需要做决策时接入工作流。这类模型的能力足以在任意输入上工作,无需为了纳入新的分类类别而不断重新训练模型。这与大语言模型(LLM)的世界形成了鲜明对比:LLM 大体上是非确定性的,但其开放性足以进行推理,并为智能体(agentic)工作负载生成文本和工具调用。 今天,我们发布了两个由 Cloudflare 训练的决策模型——Clef 和 Clef-flash,托管在 Workers AI 上(https://developers.cloudflare.com/workers-ai/models/clef)。在针对 Jev Decision Index(https://huggingface.co/spaces/multimodalart/jev-decision-index)进行评测时,Clef 目前位居榜首,你可以在实时基准测试演示站点(https://clef-evals.workers-ai-mle.workers.dev/)上查看完整结果。这些模型更智能、更快,并且完全兼容 Jev API,因此你可以轻松地对这些托管模型进行实验。我们已在 Hugging Face 上以 Apache 2.0 许可证完全开源这些模型(https://huggingface.co/Cloudflare/clef),供你本地运行并自行实验。 ![decision-index-vs-latency.png](decision-index-vs-latency.png) 最后,我们很高兴推出全新的强化学习(RL)产品,它允许客户针对各自的用例对 Clef 进行微调。 ## 什么是决策模型? 决策模型会做出分类判断,基于特定概率帮助智能体决定如何行动。例如,你可以传入一条客户支持消息(输入),询问它是否紧急,以及应该由哪个团队处理。决策模型会返回带概率的类型化答案(输出),你的代码可以据此路由工单、触发升级处理,或转交人工处理。这意味着在智能体决策中不再一定需要人类参与循环——智能体可以以编程方式收集上下文、做出决策并执行任务,或在需要时转交人类。 具体到 Cloudflare,我们一直在威胁情报(Threat Intelligence)团队测试我们新的 Clef 模型,帮助对网站域名进行分类。将一个域名交给 Clef(配合 Browser Run),它可以快速识别该域名所属的类别——例如,它可能以 95% 的概率将某个域名分类为时尚网站,85% 为电商,小于 1% 为钓鱼网站,等等。这次分类,我们的 Clef 模型耗时 2.2 秒完成网页抓取、渲染和分类。相比之下,我们最快的通用 LLM gpt-oss-120b 在相同流程中耗时 4.7 秒,且只返回了两个分类结果。作为用户,你可以想象,延迟和结果上的 2 倍节省如何帮助我们改进威胁情报工作流,并更快地识别恶意或合法域名。将其推广到任何需要快速做出程序化决策的用例,你就能解锁强大的智能体工作流,使其能够自主地决策、推理并执行。 在乐理中,谱号(clef)是放在五线谱开头的符号,它为谱线和谱间分配具体的音高名称。决策模型与音乐谱号类似,因为它有助于定义上下文的域,以及随之而来的音符(行动)。我们将决策模型家族命名为 Clef,因为它起着类似的作用,而 CF 则呼应了 Cloudflare。 ## Clef 与其他决策模型有何不同? 尽管决策模型市场正变得日益饱和,Clef 仍具有一些独特属性,让我们对将其发布给公众感到兴奋。首先,它配备了一个视觉编码器(vision encoder),能够接收图像并对视觉内容进行分类。这与 Jev 不同,Jev 目前仅支持文本分类。其次,我们的模型拥有 64k 的上下文窗口(相比之下 Jev 为 32k),这让用户能够向模型输入更多状态以供分类。 第三,我们的模型准确且强大,在针对 Jev Decision Index(https://huggingface.co/spaces/multimodalart/jev-decision-index)所定义的决策能力的各类质量基准测试上,与其他决策模型相比都具有竞争力。我们在下方筛选出了一些对决策能力而言重要的评测,并在这些项目上为市场上一些更流行的模型打分。你可以查看下面的基准测试表格,或在我们的实时决策指数演示站点(https://clef-evals.workers-ai-mle.workers.dev/)上查看分数: | 基准测试 | **Clef** (https://huggingface.co/Cloudflare/clef) | **Clef-flash** (https://huggingface.co/Cloudflare/clef-flash) | **Jev** (https://typesafe.ai/blog/introducing-system-one-models-and-jev) | DiffusionGemma Jev | **Kev 9B** (https://huggingface.co/jaredpalmer/kev-9b) | **Laya** (https://huggingface.co/convaiinnovations/laya) | | --- | --- | --- | --- | --- | --- | --- | | BFCL · 完全匹配(case exact) | 98.47 | **98.76** | 95.75 | 96.52 | 94.51 | 38.13 | | ToolRet · nDCG@10 | **69.19** | 66.43 | 65.28 | 61.21 | 64.26 | 12.69 | | API-Bank · 准确率 | 91.93 | **93.11** | 88.19 | 83.66 | 56.30 | 11.41 | | 家用电器(Home appliances)· 完全匹配 | 82.95 | **97.73** | 52.27 | 42.05 | 25.00 | 0.00 | | When2Call · 准确率 | 72.37 | 65.58 | **80.97** | 75.44 | 49.62 | 11.94 | | BANKING77 · macro-F1 | **94.20** | 90.93 | 79.74 | 74.28 | 84.83 | 14.29 | | CLINC150+OOS · macro-F1 | **97.43** | 66.77 | 89.27 | 83.49 | 79.03 | 3.19 | | BRIGHT · nDCG@10 | 45.91 | 39.26 | **47.52** | 42.94 | 38.53 | 19.90 | | Amazon ESCI · macro-F1 | **57.48** | 57.39 | 55.21 | 53.37 | 49.22 | 24.40 | | PhishNChips · 准确率 | 79.60 | 75.05 | 62.55 | **85.35** | 50.75 | 50.15 | 我们还在 Typesafe 自己的评测套件(https://huggingface.co/collections/typesafe/workflowevals)上运行了基准测试,我们的 Clef 模型表现出色,在 4 个领域中的 3 个击败了 Jev。值得注意的是,考虑到 Clef-flash 的速度要快得多,它在这些评测中的表现尤其出色。 | 工作流 | **Clef** (https://huggingface.co/Cloudflare/clef) | **Clef-flash** (https://huggingface.co/Cloudflare/clef-flash) | **Jev** (https://typesafe.ai/blog/introducing-system-one-models-and-jev) | | --- | --- | --- | --- | | 发票处理(Invoice processing) | **64.7** | 57.1 | 61.8 | | 客户服务(Customer service) | 76.3 | **77** | 76.0 | | 安全事件(Security incidents) | **62.9** | 61.7 | 61.7 | | 智能体轨迹可观测性(Agent trace observability) | 68.5 | 69.8 | **71.6** | 在我们运行的全部 43 项评测基准中,我们的 Clef 模型在延迟上击败了所有决策模型(除了 Laya——它非常快,但在上述基准测试中牺牲了质量): | 基准测试 | **Clef** (https://huggingface.co/Cloudflare/clef) | **Clef-flash** (https://huggingface.co/Cloudflare/clef-flash) | **Jev** (https://typesafe.ai/blog/introducing-system-one-models-and-jev) | DiffusionGemma Jev | **Kev-9B** (https://huggingface.co/jaredpalmer/kev-9b) | **Laya** (https://huggingface.co/convaiinnovations/laya) | | --- | --- | --- | --- | --- | --- | --- | | 中位延迟 · 毫秒 | 209.3 | 38.8 | 524.1 | 84.4 | 51.4 | **5.8** | | p95 延迟 · 毫秒 | 238.6 | **122.4** | 536.0 | 211.2 | 187.9 | 222.5 | 除了模型本身带来的延迟优势外,我们的 Clef 模型托管在 Workers AI 上。由于它们托管在 Cloudflare 的基础设施上,我们能够利用位于边缘节点的 GPU,从而实现低网络延迟和更快的决策。这意味着你可以将 Clef 放入智能体的热路径(hot path)中进行决策,并将其与我们在 Workers AI 上的某个 LLM 结合起来执行操作。 ```bash curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \ -X POST \ -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \ -d '{ "model": "clef", "state": "Checkout has been failing for every customer for the last hour.", "questions": { "urgent": { "type": "noul", "instructions": "Is this support request urgent?" }, "team": { "type": "choice", "instructions": "Which team should handle this request?", "criteria": { "billing": "Payments, invoices, and refunds", "technical": "Outages, errors, and configuration", "sales": "Plans and upgrades" } }, "severity": { "type": "score", "instructions": "How severe is the customer impact?", "criteria": ["No impact", "Minor", "Major", "Critical"] } } }' ``` Clef 同样会产生与 Jev 类似的严格类型化输出,并且完全兼容 API,因此切换起来非常容易。较大的 Clef 模型是更强大的精准模型,而 Clef-flash 则非常适合延迟敏感的决策场景。这些模型已达到企业级要求,并附带我们的承诺:我们不会读取、存储或在你的请求或响应上进行训练(除非你想使用我们的微调产品,详见下文)。你今天就可以开始使用 Clef 模型,可以先从我们的开发者文档(https://developers.cloudflare.com/workers-ai/models/clef)入手,也可以在 Hugging Face 仓库中试玩开源模型(https://huggingface.co/Cloudflare/clef)。 如果你希望有人协助针对特定工作负载调优 Clef,我们也在提供微调服务——先由我们的前沿部署工程师(FDE,forward-deployed engineer)团队以深度参与的合作伙伴方式提供,之后再为客户推出自助式微调平台,以便他们训练模型并将其重新部署到 Cloudflare 上。 ### 我们是如何训练 Clef 的 在 Jev 发布的同一周,我们发布了一篇关于自研决策模型实验的文章(https://x.com/michellechen/status/2101091012559151480)。在演示中,我们介绍了如何改造 DiffusionGemma 模型,通过暴露大语言模型生成的 logprobs 来输出确定性的概率。我们最初的方案建立在 Matt Mastracci(https://x.com/mmastrac)独立研究的基础上,他一直在机器学习(ML)社区活跃,分享新想法并为 vLLM(https://github.com/vllm-project/vllm/pull/57250)推理引擎提交 PR,以增强对 DiffusionGemma 的支持。 Clef 沿用了这一理念,但采用了不同的基础模型作为主干。我们目前使用 Qwen 作为基础模型,并针对决策模型的用例进行了后训练(post-training)。在推理过程中,Clef 使用 Qwen 仅执行一次 prefill(预填充)遍历,然后并行地对所有合法的 schema 选项进行打分。决策步骤是非自回归(non-autoregressive)的,因此没有需要逐个 token 生成的中间文本,这使得 Clef 比自回归 LLM 快得多。Clef 和 Clef-flash 不是通过生成中间文本来产出结构化答案,而是直接从内部主干表征(internal backbone representations)中推导出 schema 选项。这种方案依赖于一个专门的两阶段注意力路由过程:每个合法选项都会提取与提示(prompt)相关的上下文,使各个字段参数在打分之前能够与其他字段以及原始负载进行交叉注意力(cross-attend)。借助词法先验(lexicalian prior),模型能够在各选项之间保持语义意图。最终,该架构将选项专属的证据路由、联合的跨字段注意力以及 schema 约束的打分统一在了一起。 通过将 Clef 的 Qwen3.8-27B 与 Clef-flash 的 Qwen3.5-9B 冻结,我们将路由头(routing head)与 rank-256 的低秩适配器(low-rank adapters)进行联合优化。我们的后训练对合法 schema 输出使用标签平滑交叉熵(label-smoothed cross-entropy),并配合 Brier loss 来优化概率校准。这次训练利用了我们自有的内部合成数据集,对字段顺序、提示词和 schema 结构进行了排列组合。我们还开发了“校准决策的强化学习”(RLCD,Reinforcement Learning for Calibrated Decisions)作为次要优化目标,它会对相邻的序数选项给予部分加分、奖励完全精确的记录输出,并施加参考惩罚(reference penalty)以防止分布偏移,从而为我们带来更好的准确性和泛化能力。 这意味着我们能够用 Clef 实现几项新颖的成果:提升了模型在分类上的准确率、将其约束为仅输出概率而非生成文本,并且使它比 Jev 和基础 Qwen 模型都更快。 ### 微调如何扩展 Clef 的能力 我们听到了许多内部用例,这些用例都需要对我们的 Clef 模型进行微调,以构建到 Cloudflare 的智能体工作流中。例如,内部团队希望分类模型能够评估信任与安全(Trust & Safety)提交的内容、帮助我们对 Cloudflare Support 请求进行分类,甚至希望将其内置到我们的 Bot 产品中,以判断某个爬虫是“好机器人”还是“坏机器人”。 这些用例极其具体,而我们多年来积累了大量带标签的决策数据,可用于训练专用的分类器。当你对模型进行微调时,可能会牺牲一部分通用性能,以换取在特定领域内更高的准确率。由于 Cloudflare 拥有横跨不同领域、长达 15 年以上的网络数据,我们可以微调模型以适应这些特定用例,这比我们通用的 Clef 模型更准确、也更快。我们已经在与内部团队合作,研究如何对 Clef 进行后训练,以打造强大的机器学习模型,增强我们的影响力并改进整个 Cloudflare 的工作流。这些内部团队和用例正是我们新成立的 FDE 微调团队的下一阶段职责,也是我们强化学习(RL)产品的基础。 ### 我们的全新 RL 服务 我们正在提供一项服务,通过我们深度参与的 FDE 团队,帮助客户针对各自的工作负载微调 Clef。在此基础上,我们将从这些实战经验中学习,构建一个自助平台,让客户能够采集数据、微调模型并在 Cloudflare 上完成重新部署,全流程都在 Cloudflare 上进行。 这其实已经酝酿了很久——我们一直在构建 AI 平台,打造合适的原语(primitives),以便能够在此基础上构建定制的 RL 产品。Jev 引发的关注表明了市场对快速、小巧、专用的分类模型的需求,而我们选择以此作为切入点,开始探索 RL 环境。 为此,我们利用了 Cloudflare 平台上已有的原语: - **Cloudflare AI Gateway** – 将你所有的 AI 流量通过 AI Gateway 传递,并自动为你自己的用例创建一个请求数据集 - **Cloudflare Workers AI** – 针对基础 Clef 模型生成 rollout(轨迹数据) - **Cloudflare Containers** – 用于对智能体行动进行打分和回放的 RL 沙箱 - **[NEW] Trainer** – 更新微调后 Clef 模型的权重 - **Cloudflare Workers AI + BYO Model** – 在 Workers AI 上重新部署微调后的模型 这整合了我们 AI 平台中几个仍在推进中的部分,包括能够捕获你的 AI 流量、让你得以利用自有请求/响应数据的 AI Gateway,用于 RL 沙箱的 Containers,以及自收购 Replicate 以来持续进展的 Workers AI Bring Your Own Model(Cog,自带模型)项目。 ### 今天就来试试吧 我们很高兴今天由 Workers AI 团队推出我们第一个 Cloudflare 训练的机器学习模型。我们在这里仍处于早期阶段,还有很多改进在计划之中,但它是 AI 平台团队辛勤工作的精彩首秀。我们相信 Clef 有能力颠覆我们使用智能体的方式,这与 Cloudflare 成为“智能体云(agent cloud)”的使命不谋而合。 如果你有具体的用例,并且已经是这些产品的客户——我们很乐意与你交流,并在我们探索这一领域的过程中担任设计合作伙伴。(https://www.cloudflare.com/resource/clef-rl-interest) 试试托管在 Workers AI 上的 Clef 模型,如果你想自行探索,可以在 Hugging Face 上下载权重(https://huggingface.co/Cloudflare/clef),如有关于微调的需求,也欢迎与我们联系。

相似文章

Clef

Product Hunt

Cloudflare 推出 Clef 和 Clef-flash,这两款开源决策模型托管于 Workers AI,可实现高速分类和智能体工作流;同时还发布了新的强化学习平台,让开发者使用自己的数据对决策模型进行微调。

Clef:Cloudflare 发布的开放权重决策模型

Reddit r/LocalLLaMA

Cloudflare 发布了 Clef,这是一个开放权重的 27B 多模态决策模型。它以一个状态和一组带类型的结构化问题作为输入,通过一次前向传播直接输出每个选项的概率,无需自由文本生成,也无需解析输出。该模型在 Qwen3.8-27B 基础上进行后训练,已发布于 Hugging Face,并提供更小的 Clef-Flash 变体,同时兼容 Jev/SystemOne API。

@victormustar: 提醒:Cloudflare 刚刚在 Hugging Face 上发布了 Jev 的替代方案(Apache 2.0)

X AI KOLs Timeline

Cloudflare 在 Hugging Face 上发布了 Clef,一个开源(Apache 2.0)的 27B 多模态决策模型。它能将一个状态和一份带类型的问题 schema 转化为所有选项的概率,且只需一次前向传播即可完成。Clef 基于 Qwen3.8-27B 后训练而来,不支持自由文本生成,并且与 Jev 和 SystemOne 的 API 兼容,另有一个更小的 Clef-Flash 变体可供选择。

@MiaAI_lab: Cloudflare 的 Clef 仅用两周就超越了 Jev 方法:"冻结"的 Qwen 只做一次 prefill,一个极小的 schema head 对每个……

X AI KOLs Timeline

Cloudflare 发布了 Clef,这是一个开源的 27B 多模态决策模型,采用冻结的 Qwen 主干网络和一个极轻量的 schema 头部,在单次前向传播中对所有答案选项进行打分,无需文本生成,速度可达 Jev 的 4 倍,准确率最高可达其 2 倍。体积更小、速度更快的变体 Clef-Flash 也已在 Hugging Face 上发布。

Cloudflare/clef-flash

Hugging Face Models Trending

Cloudflare 发布了 Clef-Flash,这是一个基于 Qwen3.5-9B 构建的 9B 多模态决策模型,能够在单次前向传播中将一个状态和一组带类型问题的 schema 转换为各选项的概率,无需自由文本生成或输出解析。