Cloudflare 发布开源决策模型 Clef 与强化学习微调平台
概览
Cloudflare 发布了两个由其训练的决策模型:Clef 和 Clef-flash。这两个模型托管在 Workers AI 上,面向高速分类、结构化决策输出和智能体工作流,并以 Apache 2.0 许可证开源。
同时,Cloudflare 还推出了新的强化学习(RL)产品,允许客户使用自己的数据对 Clef 进行微调,以适配特定业务场景。
什么是决策模型?
决策模型用于根据输入内容做分类或判断,并返回带概率的结构化输出。它不同于通用大语言模型:
- 大语言模型通常用于开放式推理、文本生成和工具调用;
- 决策模型更强调低成本、低延迟、一致性和有边界的结构化输出;
- 它适合被放入工作流中,在需要程序化判断时快速给出结果。
例如,在客服场景中,可以把一条用户消息传入模型,询问它是否紧急、应由哪个团队处理。模型会返回类型化答案和概率,系统即可据此自动路由工单、触发升级,或在需要时转交人工。
Clef 的一个内部测试场景
Cloudflare 表示,已经在其威胁情报团队中测试 Clef,用于网站域名分类。给定一个域名后,Clef 可结合 Browser Run 快速识别该网站可能属于哪些类别。
示例分类结果可能包括:
- 95% 概率为时尚网站;
- 85% 概率为电商网站;
- 小于 1% 概率为钓鱼网站。
在该工作流中,Clef 完成网站抓取、渲染和分类耗时 2.2 秒。作为对比,Cloudflare 提到其最快的通用 LLM gpt-oss-120b 在同一流程中耗时 4.7 秒,且只返回了两个分类。
这类能力适用于需要快速程序化判断的场景,例如安全分析、内容分类、客服路由、工作流分派等。
Clef 与其他决策模型的差异
Cloudflare 强调 Clef 具备以下特性:
-
支持视觉输入
Clef 带有视觉编码器,可以接收图像并对视觉内容进行分类。Cloudflare 将其与当前只做文本分类的 Jev 进行了对比。 -
更长上下文窗口
Clef 支持 64k 上下文窗口,而文中对比的 Jev 为 32k。更长上下文意味着用户可以向模型输入更多状态信息用于分类。 -
严格类型化输出
Clef 生成类似 Jev 的严格类型化输出,并兼容 Jev API,便于已有系统替换或试用。 -
不同定位的两个模型
- Clef:更偏向高精度决策;
- Clef-flash:更适合延迟敏感型决策。
基准测试表现
Cloudflare 在多个决策相关基准上对 Clef、Clef-flash 以及其他模型进行了比较。以下为文中列出的部分结果。
Jev Decision Index 相关评测
| Benchmark | Clef | Clef-flash | Jev | DiffusionGemma Jev | Kev 9B | Laya |
|---|---|---|---|---|---|---|
| BFCL · case exact | 98.47 | 98.76 | 95.75 | 96.52 | 94.51 | 38.13 |
| ToolRet · nDCG@10 | 69.19 | 66.43 | 65.28 | 61.21 | 64.26 | 12.69 |
| API-Bank · accuracy | 91.93 | 93.11 | 88.19 | 83.66 | 56.30 | 11.41 |
| Home appliances · case exact | 82.95 | 97.73 | 52.27 | 42.05 | 25.00 | 0.00 |
| When2Call · accuracy | 72.37 | 65.58 | 80.97 | 75.44 | 49.62 | 11.94 |
| BANKING77 · macro-F1 | 94.20 | 90.93 | 79.74 | 74.28 | 84.83 | 14.29 |
| CLINC150+OOS · macro-F1 | 97.43 | 66.77 | 89.27 | 83.49 | 79.03 | 3.19 |
| BRIGHT · nDCG@10 | 45.91 | 39.26 | 47.52 | 42.94 | 38.53 | 19.90 |
| Amazon ESCI · macro-F1 | 57.48 | 57.39 | 55.21 | 53.37 | 49.22 | 24.40 |
| PhishNChips · accuracy | 79.60 | 75.05 | 62.55 | 85.35 | 50.75 | 50.15 |
Typesafe 工作流评测
Cloudflare 还使用 Typesafe 的评测套件进行了测试,并表示 Clef 系列在 4 个领域中有 3 个超过 Jev。
| Workflow | Clef | Clef-flash | Jev |
|---|---|---|---|
| Invoice processing | 64.7 | 57.1 | 61.8 |
| Customer service | 76.3 | 77 | 76.0 |
| Security incidents | 62.9 | 61.7 | 61.7 |
| Agent trace observability | 68.5 | 69.8 | 71.6 |
延迟表现
Cloudflare 表示,在其运行的 43 个评测基准中,Clef 系列在延迟方面具有优势;Laya 的中位延迟非常低,但在前述质量基准中表现较弱。
| Benchmark | Clef | Clef-flash | Jev | DiffusionGemma Jev | Kev-9B | Laya |
|---|---|---|---|---|---|---|
| Median latency · ms | 209.3 | 38.8 | 524.1 | 84.4 | 51.4 | 5.8 |
| p95 latency · ms | 238.6 | 122.4 | 536.0 | 211.2 | 187.9 | 222.5 |
部署与使用方式
Clef 和 Clef-flash 托管在 Workers AI 上。Cloudflare 称,其边缘 GPU 基础设施可降低网络延迟,使这些模型适合放入智能体的关键路径中,用于快速决策,并可与 Workers AI 上的 LLM 组合执行后续动作。
模型也已开源,采用 Apache 2.0 许可证,开发者可以在本地运行和实验。
Cloudflare 还表示,企业使用托管模型时,默认不会读取、存储或使用用户请求与响应进行训练;若客户使用其微调产品,则另行处理相关数据。
强化学习微调平台
除模型发布外,Cloudflare 还推出了新的强化学习产品,允许开发者或客户使用自己的数据对 Clef 进行微调。该能力面向需要定制决策逻辑的业务场景,例如内部分类体系、专有工作流、企业安全策略或特定客服路由规则。
小结
Clef 和 Clef-flash 体现了决策模型在智能体工作流中的一个方向:不直接替代通用 LLM,而是在需要快速、稳定、结构化判断的环节承担分类和决策职责。对于延迟敏感、需要类型化输出、且希望降低通用 LLM 调用成本的应用,这类模型值得关注。
