Cloudflare 发布开源决策模型 Clef 与强化学习微调平台

Cloudflare AI Bl3 天前

概览

Cloudflare 发布了两个由其训练的决策模型:Clef 和 Clef-flash。这两个模型托管在 Workers AI 上,面向高速分类、结构化决策输出和智能体工作流,并以 Apache 2.0 许可证开源。

同时,Cloudflare 还推出了新的强化学习(RL)产品,允许客户使用自己的数据对 Clef 进行微调,以适配特定业务场景。

什么是决策模型?

决策模型用于根据输入内容做分类或判断,并返回带概率的结构化输出。它不同于通用大语言模型:

  • 大语言模型通常用于开放式推理、文本生成和工具调用;
  • 决策模型更强调低成本、低延迟、一致性和有边界的结构化输出;
  • 它适合被放入工作流中,在需要程序化判断时快速给出结果。

例如,在客服场景中,可以把一条用户消息传入模型,询问它是否紧急、应由哪个团队处理。模型会返回类型化答案和概率,系统即可据此自动路由工单、触发升级,或在需要时转交人工。

Clef 的一个内部测试场景

Cloudflare 表示,已经在其威胁情报团队中测试 Clef,用于网站域名分类。给定一个域名后,Clef 可结合 Browser Run 快速识别该网站可能属于哪些类别。

示例分类结果可能包括:

  • 95% 概率为时尚网站;
  • 85% 概率为电商网站;
  • 小于 1% 概率为钓鱼网站。

在该工作流中,Clef 完成网站抓取、渲染和分类耗时 2.2 秒。作为对比,Cloudflare 提到其最快的通用 LLM gpt-oss-120b 在同一流程中耗时 4.7 秒,且只返回了两个分类。

这类能力适用于需要快速程序化判断的场景,例如安全分析、内容分类、客服路由、工作流分派等。

Clef 与其他决策模型的差异

Cloudflare 强调 Clef 具备以下特性:

  1. 支持视觉输入
    Clef 带有视觉编码器,可以接收图像并对视觉内容进行分类。Cloudflare 将其与当前只做文本分类的 Jev 进行了对比。

  2. 更长上下文窗口
    Clef 支持 64k 上下文窗口,而文中对比的 Jev 为 32k。更长上下文意味着用户可以向模型输入更多状态信息用于分类。

  3. 严格类型化输出
    Clef 生成类似 Jev 的严格类型化输出,并兼容 Jev API,便于已有系统替换或试用。

  4. 不同定位的两个模型

    • Clef:更偏向高精度决策;
    • Clef-flash:更适合延迟敏感型决策。

基准测试表现

Cloudflare 在多个决策相关基准上对 Clef、Clef-flash 以及其他模型进行了比较。以下为文中列出的部分结果。

Jev Decision Index 相关评测

Benchmark Clef Clef-flash Jev DiffusionGemma Jev Kev 9B Laya
BFCL · case exact 98.47 98.76 95.75 96.52 94.51 38.13
ToolRet · nDCG@10 69.19 66.43 65.28 61.21 64.26 12.69
API-Bank · accuracy 91.93 93.11 88.19 83.66 56.30 11.41
Home appliances · case exact 82.95 97.73 52.27 42.05 25.00 0.00
When2Call · accuracy 72.37 65.58 80.97 75.44 49.62 11.94
BANKING77 · macro-F1 94.20 90.93 79.74 74.28 84.83 14.29
CLINC150+OOS · macro-F1 97.43 66.77 89.27 83.49 79.03 3.19
BRIGHT · nDCG@10 45.91 39.26 47.52 42.94 38.53 19.90
Amazon ESCI · macro-F1 57.48 57.39 55.21 53.37 49.22 24.40
PhishNChips · accuracy 79.60 75.05 62.55 85.35 50.75 50.15

Typesafe 工作流评测

Cloudflare 还使用 Typesafe 的评测套件进行了测试,并表示 Clef 系列在 4 个领域中有 3 个超过 Jev。

Workflow Clef Clef-flash Jev
Invoice processing 64.7 57.1 61.8
Customer service 76.3 77 76.0
Security incidents 62.9 61.7 61.7
Agent trace observability 68.5 69.8 71.6

延迟表现

Cloudflare 表示,在其运行的 43 个评测基准中,Clef 系列在延迟方面具有优势;Laya 的中位延迟非常低,但在前述质量基准中表现较弱。

Benchmark Clef Clef-flash Jev DiffusionGemma Jev Kev-9B Laya
Median latency · ms 209.3 38.8 524.1 84.4 51.4 5.8
p95 latency · ms 238.6 122.4 536.0 211.2 187.9 222.5

部署与使用方式

Clef 和 Clef-flash 托管在 Workers AI 上。Cloudflare 称,其边缘 GPU 基础设施可降低网络延迟,使这些模型适合放入智能体的关键路径中,用于快速决策,并可与 Workers AI 上的 LLM 组合执行后续动作。

模型也已开源,采用 Apache 2.0 许可证,开发者可以在本地运行和实验。

Cloudflare 还表示,企业使用托管模型时,默认不会读取、存储或使用用户请求与响应进行训练;若客户使用其微调产品,则另行处理相关数据。

强化学习微调平台

除模型发布外,Cloudflare 还推出了新的强化学习产品,允许开发者或客户使用自己的数据对 Clef 进行微调。该能力面向需要定制决策逻辑的业务场景,例如内部分类体系、专有工作流、企业安全策略或特定客服路由规则。

小结

Clef 和 Clef-flash 体现了决策模型在智能体工作流中的一个方向:不直接替代通用 LLM,而是在需要快速、稳定、结构化判断的环节承担分类和决策职责。对于延迟敏感、需要类型化输出、且希望降低通用 LLM 调用成本的应用,这类模型值得关注。

评论

请登录后发表观点

暂无数据