跳转到主要内容
Beehive
导航
Home 实用工具 最后修订:2026.07.20 · 10 min

Cloudflare Workers AI 指南:免费在边缘网络跑 50+ AI 模型,无需管理 GPU

Cloudflare Workers AI 是一个在 Cloudflare 全球边缘网络上运行的 serverless AI 推理平台,提供 50+ 开源模型、每天 1 万 Neurons 免费额度、无需管理 GPU 基础设施,支持 LLM、图像生成、语音转文字等场景。

实用工具

一、Workers AI 是什么

Cloudflare Workers AI 是 Cloudflare 推出的 serverless AI 推理平台。它在 Cloudflare 全球 200+ 城市的边缘网络上运行 GPU,让你通过一个 API 调用就能使用 50 多个开源 AI 模型——不需要租 GPU、不需要管扩容、不需要为闲置算力买单。

打个比方:如果你把 AWS SageMaker 或 Google Vertex AI 理解为"自己买菜做饭"(选 GPU 型号、配环境、部署模型),那 Workers AI 就是"进餐厅点菜"——告诉它你要用哪个模型、传什么数据,它直接给你结果。

一句话:Workers AI = Cloudflare 全球边缘网络 + 50+ 开源 AI 模型 + serverless 按量付费 + 每天免费 1 万 Neurons。

二、免费套餐与定价

2.1 免费额度

Workers AI 的免费额度基于 Neurons(神经元)计量,这是 Cloudflare 定义的计算单位,代表完成一次 AI 请求所需的 GPU 算力。

计划 免费额度 超出后
Workers Free 10,000 Neurons / 天 不可超额(需升级到 Paid)
Workers Paid 10,000 Neurons / 天 $0.011 / 1,000 Neurons

每天 10,000 Neurons 能做什么?以 LLaMA 3.2-1B 模型为例,免费额度大约可以跑 400 万输入 token55 万输出 token。对于个人开发和轻量级应用来说,这个额度相当慷慨。

不需要绑卡。 Cloudflare Workers 本身就有免费套餐,Workers AI 嵌入其中。

2.2 按模型定价(部分热门模型)

不同模型的 Neuron 消耗量不同,大模型更"贵":

模型 输入价格(每百万 token) 输出价格(每百万 token)
LLaMA 3.2-1B $0.027 $0.201
LLaMA 3.2-3B $0.051 $0.335
LLaMA 3.1-8B (FP8) $0.045 $0.384
Mistral 7B $0.064 $0.517
DeepSeek R1 Distill (32B) $0.497 $4.881
LLaMA 3.1-70B (FP8) $0.293 $2.253

(数据来源:Cloudflare Workers AI 官方定价页,2026 年 7 月 8 日更新)

所有价格模型都标注了"Neurons"消耗量,方便预估成本。计费每天 00 UTC 重置。

三、模型目录:50+ 模型开箱即用

Workers AI 提供的是一个精选的模型目录,包括但不限于:

类别 代表模型 用途
文本生成 (LLM) LLaMA 3.2/3.1系列、Mistral 7B、DeepSeek R1、Kimi K2.6、GLM 4.7 Flash、GPT-OSS-120B 对话、文本分析、代码生成
图像生成 Stable Diffusion XL、Flux.1 Schnell 文生图
语音转文字 Whisper (large-v3) 实时语音转录
文本嵌入 BGE-base、BGE-large 语义搜索、RAG 检索
视觉模型 LLaMA 3.2-11B Vision、Moondream 3.1 图像理解、物体检测

2026 年 7 月 8 日最新加入的 Moondream 3.1 是一个快速视觉语言模型(9B 总参数、2B 活跃参数),支持查询、描述、点位检测和物体检测,首个 token 延迟仅 20-30 ms,非常适合实时边缘视觉场景。

四、怎么用:一个 API 调用搞定

Workers AI 提供了三种接入方式:

4.1 在 Workers/Pages 代码中调用

// 在你的 Cloudflare Worker 中
export default {
  async fetch(request, env) {
    const response = await env.AI.run(
      '@cf/meta/llama-3.2-1b-instruct',
      {
        messages: [
          { role: 'system', content: '你是一个友好的助手' },
          { role: 'user', content: '用一句话解释什么是边缘计算' }
        ]
      }
    );
    return new Response(JSON.stringify(response));
  }
};

一行 env.AI.run() 就完成了模型调用。Workers AI 自动处理 GPU 资源分配、模型加载、扩缩容。

4.2 通过 REST API 调用

不需要 Cloudflare Worker,任何能发 HTTP 请求的环境都可以用:

curl "https://api.cloudflare.com/client/v4/accounts/$ACCOUNT_ID/ai/run/@cf/meta/llama-3.2-1b-instruct" \
  -X POST \
  -H "Authorization: Bearer $API_TOKEN" \
  -d '{"messages":[{"role":"user","content":"Hello World"}]}'

4.3 图像生成示例

const response = await env.AI.run(
  '@cf/black-forest-labs/flux-1-schnell',
  {
    prompt: 'cyberpunk city at night, neon lights',
    seed: Math.floor(Math.random() * 10)
  }
);

// response.image 是 base64 编码的图片
const binaryString = atob(response.image);
const img = Uint8Array.from(binaryString, m => m.codePointAt(0));

return new Response(img, {
  headers: { 'Content-Type': 'image/jpeg' }
});

五、与同类服务对比

对比维度 Workers AI OpenAI API Replicate Groq
模型类型 开源模型为主 闭源 + 部分开源 社区上传模型 开源模型
免费额度 1 万 Neurons/天 无(新用户 $5 额度) 无免费额度 有限免费
需绑卡 否(Workers Free)
运行位置 Cloudflare 全球边缘 OpenAI 数据中心 云端 GPU 云端 LPU
延迟优势 边缘推理,20-30ms 起步 取决于区域 冷启动较慢 极快
生态整合 Workers/Pages/R2/Vectorize/D1 独立 API 独立 API 独立 API

Workers AI 的核心差异化在于 边缘部署——模型运行在离用户最近的 Cloudflare 节点,而不是某个区域的中心机房。这对于需要低延迟的实时 AI 应用(聊天机器人、语音助手、实时翻译)是巨大的优势。

同时它和 Cloudflare 生态无缝集成:AI 推理结果可以直接存入 R2 对象存储、用 Vectorize 做向量检索、通过 AI Gateway 做统一监控和缓存。这些对于构建完整的 AI 应用非常关键。

六、生态整合

Workers AI 不是独立存在的,它是 Cloudflare AI 平台的核心组件之一:

产品 Workers AI 如何配合
推理 Workers AI 运行模型本身
向量存储 Vectorize 存储和检索文本/图像向量,构建 RAG 应用
数据存储 R2 / D1 / KV 存储原始数据、模型输出、用户数据
监控控制 AI Gateway 统一缓存、限流、日志、成本追踪
计算层 Workers / Pages 运行应用逻辑,串联各个服务

一个典型的使用流程:用户在 Pages 前端提交问题 → Worker 接收请求 → 用 Workers AI 的 Embedding 模型把问题转为向量 → 到 Vectorize 检索相关知识 → 把知识作为上下文发给 Workers AI 的 LLM → 生成回答返回给用户。整个链路都在 Cloudflare 上,不需要任何外部服务。

七、适用场景

  • AI 聊天机器人:在 Workers 中部署 LLM 推理,全球边缘毫秒级响应
  • RAG(检索增强生成):Workers AI 的 Embedding 模型 + Vectorize 向量数据库,构建知识问答系统
  • 图像生成服务:Flux / Stable Diffusion 生成图片,存入 R2 对象存储
  • 语音转文字:Whisper 实时转录,集成到语音助手或笔记应用
  • 内容审核:用视觉模型检测上传图片,用文本模型审查内容
  • 代码辅助:GPT-OSS-120B 专为编程和调试优化

八、2026 年 7 月最新动态

  • 7 月 8 日:Moondream 3.1 视觉模型上线,支持在边缘实时查询、描述和物体检测,首个 token 延迟 20-30 ms
  • 7 月 8 日:toMarkdown 功能扩展,新增 GIF 和 BMP 图片格式支持
  • 7 月:定价模式更新为更细粒度的按模型单元定价,LLaMA 3.2-1B 输入仅 $0.027/百万 token
  • 7 月 7 日:Cloudflare Drop 上线,无需注册账号即可部署静态站点并获得临时分享链接

九、如何开始

  1. 注册 Cloudflare 账号(免费,不需要绑卡)
  2. 进入 Workers & Pages → 创建 Worker
  3. 在 Worker 代码中直接使用 env.AI.run() 调用模型
  4. 或在 AI Playground 中在线测试所有模型
  5. 绑定自定义域名,部署到生产环境

如果你已经有 Cloudflare 账号,在 dash.cloudflare.com/ai 就能看到 AI 控制台,所有模型的开箱测试、API 示例都准备好了。

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

实用工具
文章链接已复制到剪贴板