Cloudflare Workers AI 新增 30+ 模型,支持 LoRA 微调推理

Cloudflare 宣布 Workers AI 平台大幅扩展模型库,新增 30 多个开源模型,涵盖 Llama 3、Mistral、Qwen 2、Stable Diffusion 3 等热门模型。同时引入 LoRA(Low-Rank Adaptation)适配器推理支持。

LoRA 适配器推理

LoRA 是一种高效的模型微调方法,生成的小文件(通常几 MB 到几十 MB)可以叠加在基础模型上进行推理。这意味着用户可以在 Cloudflare 的边缘节点上运行微调后的定制模型,而无需部署完整的模型副本。

定价模式

Workers AI 按推理时长计费,无 GPU 预留费用。这对于间歇性的 AI 推理工作负载来说成本优势明显,特别是冷启动不再是问题——因为模型已预热在边缘节点上。

16IDC 观察

Workers AI 的 LoRA 支持是一个值得关注的能力。对于希望使用定制 AI 模型但又不想管理 GPU 基础设施的中小型团队来说,边缘 AI 推理提供了一个有吸引力的中间选项。

事件背景:边缘 AI 推理的版图扩张

Cloudflare Workers AI 自 2023 年推出以来,一直在稳步扩展其模型库和推理能力。此次新增 30+ 模型和 LoRA 支持,是其「让 AI 推理在边缘触手可及」愿景的重要一步。

边缘 AI 推理的核心逻辑是:将 AI 模型部署在离用户最近的节点上,而不是在远离用户的核心数据中心。这样可以显著降低推理响应延迟,也减少了回源网络的负载。对于全球性网站和实时 AI 应用来说,边缘推理可以大幅提升用户体验。

Cloudflare 在这方面有独特优势——它拥有全球最大的边缘网络之一(330+ 城市),理论上可以在任意节点上运行 AI 推理。这是 AWS、Azure 和 GCP 难以复制的,因为它们的边缘节点密度远不及 Cloudflare。

对建站者的实际影响

Workers AI 的适用性分析

使用场景 Workers AI 是否合适 推荐方案
实时文本翻译 ✅ 非常适合 Workers AI + LoRA 适配器
内容分类/标签 ✅ 非常适合 Workers AI 预置模型
图像生成 ⚠️ 可用但有限制 轻量级模型适用
聊天机器人 ✅ 适合非高峰 注意冷启动和并发限制
大规模模型训练 ❌ 不支持 使用云 GPU 实例
高并发生产推理 ⚠️ 需要评估 关注定价和速率限制

LoRA 支持的实际意义

LoRA 适配器推理是一个被低估的重要功能。它的实际价值在于:

  1. 定制化模型无需完整部署:你只需要上传一个几 MB 到几十 MB 的 LoRA 适配器文件,就可以在基础模型上获得定制化的推理结果
  2. 多个适配器共享一个基础模型:不同业务场景可以使用不同的 LoRA 适配器,而不需要为每个场景部署独立的模型
  3. 快速迭代:更新 LoRA 适配器比重新训练和部署完整模型快得多

使用限制分析

Workers AI 并不是万能的。需要注意以下限制:

  • 单次推理超时限制:复杂推理任务可能超过执行时间限制
  • 并发配额:免费和入门计划的并发推理数有限
  • 模型大小限制:超大模型可能无法在边缘节点上运行
  • 不支持自定义模型上传(仅限 LoRA 适配器):如果你需要完全自定义的模型架构,Workers AI 不适用

可操作建议

  1. 从简单场景开始:先用 Workers AI 实现文本分类、翻译、内容审核等轻量级功能
  2. 利用 LoRA 实现定制化:如果需要定制化输出,训练 LoRA 适配器而不是完整的模型
  3. 设计降级策略:当 Workers AI 不可用或超限时,要有 fallback 方案(如回退到自建推理服务)
  4. 监控推理成本:Workers AI 按推理时长计费,高并发场景下成本需提前评估
  5. 关注 Workers AI 路线图:Cloudflare 正在积极扩展 Workers AI 的能力,建议关注新功能和模型更新

深度思考:边缘推理 vs 云端推理的选型框架

选择边缘推理还是云端推理,可以从以下维度评估:

  • 延迟要求:< 100ms → 边缘推理;100-500ms → 可选;> 500ms → 云端推理即可
  • 数据量:大规模数据预处理 → 云端推理(边缘带宽有限)
  • 模型大小:小模型(< 1GB)→ 边缘推理;大模型 → 云端推理
  • 隐私要求:数据不能离开用户本地 → 边缘推理
  • 成本结构:间歇性低负载 → 边缘推理(按需计费);持续性高负载 → 云端推理(预留实例更经济)

对于大多数网站来说,一个实用的策略是将延迟敏感、轻量级的 AI 功能放在边缘(如 Cloudflare Workers AI),将复杂、计算密集的 AI 任务放在云端(如 AWS SageMaker 或自建 GPU 集群)。

原始来源:Cloudflare Blog