一、Workers AI 是什么
Cloudflare Workers AI 是 Cloudflare 推出的 serverless AI 推理平台。它在 Cloudflare 全球 200+ 城市的边缘网络上运行 GPU,让你通过一个 API 调用就能使用 50 多个开源 AI 模型——不需要租 GPU、不需要管扩容、不需要为闲置算力买单。
打个比方:如果你把 AWS SageMaker 或 Google Vertex AI 理解为"自己买菜做饭"(选 GPU 型号、配环境、部署模型),那 Workers AI 就是"进餐厅点菜"——告诉它你要用哪个模型、传什么数据,它直接给你结果。
一句话:Workers AI = Cloudflare 全球边缘网络 + 50+ 开源 AI 模型 + serverless 按量付费 + 每天免费 1 万 Neurons。
二、免费套餐与定价
2.1 免费额度
Workers AI 的免费额度基于 Neurons(神经元)计量,这是 Cloudflare 定义的计算单位,代表完成一次 AI 请求所需的 GPU 算力。
| 计划 | 免费额度 | 超出后 |
|---|---|---|
| Workers Free | 10,000 Neurons / 天 | 不可超额(需升级到 Paid) |
| Workers Paid | 10,000 Neurons / 天 | $0.011 / 1,000 Neurons |
每天 10,000 Neurons 能做什么?以 LLaMA 3.2-1B 模型为例,免费额度大约可以跑 400 万输入 token 或 55 万输出 token。对于个人开发和轻量级应用来说,这个额度相当慷慨。
不需要绑卡。 Cloudflare Workers 本身就有免费套餐,Workers AI 嵌入其中。
2.2 按模型定价(部分热门模型)
不同模型的 Neuron 消耗量不同,大模型更"贵":
| 模型 | 输入价格(每百万 token) | 输出价格(每百万 token) |
|---|---|---|
| LLaMA 3.2-1B | $0.027 | $0.201 |
| LLaMA 3.2-3B | $0.051 | $0.335 |
| LLaMA 3.1-8B (FP8) | $0.045 | $0.384 |
| Mistral 7B | $0.064 | $0.517 |
| DeepSeek R1 Distill (32B) | $0.497 | $4.881 |
| LLaMA 3.1-70B (FP8) | $0.293 | $2.253 |
(数据来源:Cloudflare Workers AI 官方定价页,2026 年 7 月 8 日更新)
所有价格模型都标注了"Neurons"消耗量,方便预估成本。计费每天 00 UTC 重置。
三、模型目录:50+ 模型开箱即用
Workers AI 提供的是一个精选的模型目录,包括但不限于:
| 类别 | 代表模型 | 用途 |
|---|---|---|
| 文本生成 (LLM) | LLaMA 3.2/3.1系列、Mistral 7B、DeepSeek R1、Kimi K2.6、GLM 4.7 Flash、GPT-OSS-120B | 对话、文本分析、代码生成 |
| 图像生成 | Stable Diffusion XL、Flux.1 Schnell | 文生图 |
| 语音转文字 | Whisper (large-v3) | 实时语音转录 |
| 文本嵌入 | BGE-base、BGE-large | 语义搜索、RAG 检索 |
| 视觉模型 | LLaMA 3.2-11B Vision、Moondream 3.1 | 图像理解、物体检测 |
2026 年 7 月 8 日最新加入的 Moondream 3.1 是一个快速视觉语言模型(9B 总参数、2B 活跃参数),支持查询、描述、点位检测和物体检测,首个 token 延迟仅 20-30 ms,非常适合实时边缘视觉场景。
四、怎么用:一个 API 调用搞定
Workers AI 提供了三种接入方式:
4.1 在 Workers/Pages 代码中调用
// 在你的 Cloudflare Worker 中
export default {
async fetch(request, env) {
const response = await env.AI.run(
'@cf/meta/llama-3.2-1b-instruct',
{
messages: [
{ role: 'system', content: '你是一个友好的助手' },
{ role: 'user', content: '用一句话解释什么是边缘计算' }
]
}
);
return new Response(JSON.stringify(response));
}
};
一行 env.AI.run() 就完成了模型调用。Workers AI 自动处理 GPU 资源分配、模型加载、扩缩容。
4.2 通过 REST API 调用
不需要 Cloudflare Worker,任何能发 HTTP 请求的环境都可以用:
curl "https://api.cloudflare.com/client/v4/accounts/$ACCOUNT_ID/ai/run/@cf/meta/llama-3.2-1b-instruct" \
-X POST \
-H "Authorization: Bearer $API_TOKEN" \
-d '{"messages":[{"role":"user","content":"Hello World"}]}'
4.3 图像生成示例
const response = await env.AI.run(
'@cf/black-forest-labs/flux-1-schnell',
{
prompt: 'cyberpunk city at night, neon lights',
seed: Math.floor(Math.random() * 10)
}
);
// response.image 是 base64 编码的图片
const binaryString = atob(response.image);
const img = Uint8Array.from(binaryString, m => m.codePointAt(0));
return new Response(img, {
headers: { 'Content-Type': 'image/jpeg' }
});
五、与同类服务对比
| 对比维度 | Workers AI | OpenAI API | Replicate | Groq |
|---|---|---|---|---|
| 模型类型 | 开源模型为主 | 闭源 + 部分开源 | 社区上传模型 | 开源模型 |
| 免费额度 | 1 万 Neurons/天 | 无(新用户 $5 额度) | 无免费额度 | 有限免费 |
| 需绑卡 | 否(Workers Free) | 是 | 是 | 是 |
| 运行位置 | Cloudflare 全球边缘 | OpenAI 数据中心 | 云端 GPU | 云端 LPU |
| 延迟优势 | 边缘推理,20-30ms 起步 | 取决于区域 | 冷启动较慢 | 极快 |
| 生态整合 | Workers/Pages/R2/Vectorize/D1 | 独立 API | 独立 API | 独立 API |
Workers AI 的核心差异化在于 边缘部署——模型运行在离用户最近的 Cloudflare 节点,而不是某个区域的中心机房。这对于需要低延迟的实时 AI 应用(聊天机器人、语音助手、实时翻译)是巨大的优势。
同时它和 Cloudflare 生态无缝集成:AI 推理结果可以直接存入 R2 对象存储、用 Vectorize 做向量检索、通过 AI Gateway 做统一监控和缓存。这些对于构建完整的 AI 应用非常关键。
六、生态整合
Workers AI 不是独立存在的,它是 Cloudflare AI 平台的核心组件之一:
| 层 | 产品 | Workers AI 如何配合 |
|---|---|---|
| 推理 | Workers AI | 运行模型本身 |
| 向量存储 | Vectorize | 存储和检索文本/图像向量,构建 RAG 应用 |
| 数据存储 | R2 / D1 / KV | 存储原始数据、模型输出、用户数据 |
| 监控控制 | AI Gateway | 统一缓存、限流、日志、成本追踪 |
| 计算层 | Workers / Pages | 运行应用逻辑,串联各个服务 |
一个典型的使用流程:用户在 Pages 前端提交问题 → Worker 接收请求 → 用 Workers AI 的 Embedding 模型把问题转为向量 → 到 Vectorize 检索相关知识 → 把知识作为上下文发给 Workers AI 的 LLM → 生成回答返回给用户。整个链路都在 Cloudflare 上,不需要任何外部服务。
七、适用场景
- AI 聊天机器人:在 Workers 中部署 LLM 推理,全球边缘毫秒级响应
- RAG(检索增强生成):Workers AI 的 Embedding 模型 + Vectorize 向量数据库,构建知识问答系统
- 图像生成服务:Flux / Stable Diffusion 生成图片,存入 R2 对象存储
- 语音转文字:Whisper 实时转录,集成到语音助手或笔记应用
- 内容审核:用视觉模型检测上传图片,用文本模型审查内容
- 代码辅助:GPT-OSS-120B 专为编程和调试优化
八、2026 年 7 月最新动态
- 7 月 8 日:Moondream 3.1 视觉模型上线,支持在边缘实时查询、描述和物体检测,首个 token 延迟 20-30 ms
- 7 月 8 日:toMarkdown 功能扩展,新增 GIF 和 BMP 图片格式支持
- 7 月:定价模式更新为更细粒度的按模型单元定价,LLaMA 3.2-1B 输入仅 $0.027/百万 token
- 7 月 7 日:Cloudflare Drop 上线,无需注册账号即可部署静态站点并获得临时分享链接
九、如何开始
- 注册 Cloudflare 账号(免费,不需要绑卡)
- 进入 Workers & Pages → 创建 Worker
- 在 Worker 代码中直接使用
env.AI.run()调用模型 - 或在 AI Playground 中在线测试所有模型
- 绑定自定义域名,部署到生产环境
如果你已经有 Cloudflare 账号,在 dash.cloudflare.com/ai 就能看到 AI 控制台,所有模型的开箱测试、API 示例都准备好了。