Cloudflare 将 Workers AI 与 AI Gateway 合并为统一 AI 控制平面
Cloudflare 正在将 AI Gateway 与 Workers AI 逐步统一为一个 AI 控制平面。两者最初是不同产品:AI Gateway 用于代理访问各类模型服务商,并提供可观测性、日志、访问控制与安全能力;Workers AI 则基于 Cloudflare 管理的 GPU 基础设施托管模型,提供推理即服务接口。
从开发者视角看,这两类产品的目标正在趋同:都在帮助应用连接模型,并在连接层提供控制能力。Cloudflare 的新方向是让开发者通过统一路径连接任意模型服务商,包括 Workers AI,同时在同一控制平面中管理可观测性、计费、安全与日志。
统一绑定与 API 入口
Cloudflare 表示,AI Gateway 与 Workers AI 的入口正在合并,包括 Workers 绑定和 REST API。
开发者可以使用同一个 AI 绑定调用 AI Gateway 和 Workers AI,而不再需要区分单独的 AI Gateway 绑定或 Workers AI 绑定。此前推出的“默认网关”机制也被纳入其中:即使开发者未提前创建 AI Gateway,也可以自动获得 AI Gateway 的可观测性与日志能力。
如果需要按应用或项目拆分流量,开发者仍然可以指定自定义网关。
同时,Cloudflare 也推出了统一 REST API,即 /ai/ 端点,用于通过 AI Gateway 调用 Workers AI。这样一来,开发者不必在两个产品之间先做选择,而是默认获得统一入口与配套能力。
Workers AI 用户自动获得可观测性与控制能力
此次整合的直接变化之一,是 Workers AI 用户无需显式创建 AI Gateway,也可以看到推理流量的运行情况。
如果此前没有创建过网关,只需在绑定或 REST API 调用中将 gateway ID 设置为 default,AI Gateway 会在首次认证请求时自动创建默认网关。
随后,每个请求都可以被记录,并提供以下信息:
- 请求与响应载荷
- 各模型的 token 使用量
- 成本归因
- 延迟分解
- 错误率
- 提示词与模型响应内容
对于需要调试模型行为、审计 AI 输出或分析成本的团队来说,这意味着可以在不额外配置仪表盘的情况下获得更完整的推理可见性。
如果默认网关无法满足需求,例如需要自定义缓存规则,或希望按应用拆分流量,也可以创建命名网关,并通过参数调整将请求指向新的网关。
AI Gateway 积分可用于 Workers AI
Cloudflare 还宣布,AI Gateway 积分现在可以用于 Workers AI。
此前,AI Gateway 积分只能用于外部模型服务商,例如 OpenAI、Anthropic 等,尚不能用于 Workers AI。现在统一计费能力已经支持 Workers AI,这意味着开发者可以向同一个钱包充值积分,并在 OpenAI、Anthropic、Workers AI 或其他受支持服务商之间使用。
Cloudflare 同时表示,为鼓励开发者使用新的统一计费路径,使用 AI Gateway 统一计费访问 Workers AI 模型时,将提供更高的速率限制。具体限制和更高额度申请方式以开发者文档中的最新说明为准。
即将推出:模型优先路由
当所有推理流量都经过同一个控制平面后,Cloudflare 计划引入更智能的请求分发方式:从“服务商优先”转向“模型优先”。
传统方式下,开发者需要先决定调用哪个服务商。如果该服务商宕机、容量不足或触发限流,应用就可能失败。模型优先路由则让开发者先表达需求,例如:
- 需要一个推理能力强的模型
- 需要一个快速摘要模型
- 需要一个低成本 embedding 模型
控制平面再负责选择服务商、处理故障转移和负载均衡。
例如,开发者可以请求某个模型,而无需关心它来自 Workers AI、模型厂商自己的 API,还是其他托管相同权重的服务商。如果 Workers AI 有可用容量,就使用 Cloudflare 管理的基础设施;如果容量不足,网关可以透明地将请求负载均衡到其他能提供相同模型的服务商。
Cloudflare 表示,开发者仍然可以选择固定使用单一服务商;而模型优先路由主要面向更重视弹性与可靠性的场景。Cloudflare 还称会与经过筛选的服务商合作,并尽量保持模型输出质量,同时支持 Zero Data Retention 等要求。
该能力预计将在未来几个月面向 AI Gateway 与 Workers AI 用户进行试点。
下一步:智能路由
在模型优先路由之后,Cloudflare 还计划进一步推出智能路由。
智能路由不只是做故障转移,而是尝试理解用户请求,并在无需配置的情况下选择适合任务的模型。
其思路是:由运行在 Workers AI 上的分类器读取提示词,预测任务类型和复杂度,例如:
- 编程
- 研究
- 摘要
- 通用问答
系统还会评估上下文重要性,再由启发式评分器从 curated 模型池中选择合适模型。
对于需要精确控制的团队,仍然可以指定具体模型;而对希望降低维护成本的开发者,零配置路径可能带来更好的成本与性能表现。Cloudflare 表示该能力目前正在内部试点,并会在接下来几周继续测试和迭代。
对开发者意味着什么
如果已经在使用 Workers AI,可以尝试将现有调用路由到默认网关,以获得请求日志、token 跟踪和成本归因,而无需改变模型调用方式。
如果已经在使用 AI Gateway,则可以通过调用 Workers AI 模型,将 Workers AI 纳入现有网关体系,并使用统一钱包在多个模型服务商之间进行计费管理。
总体来看,Cloudflare 的方向是把模型访问、计费、观测、路由与故障处理都集中到同一个控制层中。对于构建生产级 AI 应用的团队,这类统一控制平面可能降低多模型、多服务商接入时的复杂度。
