跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.08.09 · 12 min

Cloudflare Agents Week 2026:非人类流量提前一年突破50%,一家CDN公司在重造「Agent云」

2026年8月Cloudflare Q2财报披露:AI Agent等非人类流量在5月突破50%,比原预测提前一年多。Agents Week 2026集中发布Agent Memory、AI Search、Dynamic Workers、Unweight等十几项新产品,从记忆、搜索、存储到代码执行,Cloudflare用一张全球边缘网络拼接面向AI Agent的新型云。

前沿动态

8月6日,Cloudflare 发布 2026 年 Q2 财报。营收 6.961 亿美元,同比增长 36%——数字很漂亮,但 CEO Matthew Prince 在电话会上说的另一件事才是真正的拐点:

我们原本预计非人类流量会在 2027 年下半年超过人类流量,实际在 2026 年 5 月就发生了。

AI Agent 等非人类流量占比首次突破 50%。 互联网的主要访问者,已经从「人」变成了「程序」。

Cloudflare 赌的下一件事是:当程序成为互联网的主要用户,云的形态也会跟着变。刚结束的 Agents Week 2026 就是这个赌注的集中展示——一周之内密集发布十几项面向 AI Agent 的新产品,从底层推理、记忆存储、搜索、版本控制到安全防护,几乎把「Agent 需要什么」从头到尾铺了一遍。

财报硬数据

指标 Q2 2026 同比变化
营收 $6.961 亿 +36%
年消费 $10万+ 客户数 4,698 家 +27%
季度净增大客户 986 家 历史新高
净收入留存率 (NRR) 120% 环比+2,同比+6
毛利率 73.1% 8个季度来首次环比改善
自由现金流 $5,640 万 +69%

Prince 说得很直白:「开发者正在涌向 Cloudflare,因为我们的 Workers 平台给了他们构建 Agent 未来所需的一切。」

Cloudflare 自己就是这套平台的第一个重度用户:通过 AI Gateway 路由的请求达到 2,000 万次,处理的 token 达到 2,410 亿个,在 Workers AI 上运行推理,为 3,683 名内部用户提供服务。 自己的狗食自己先吃,吃到这个体量再对外卖产品。

一周发布了什么

按功能层划分:

层级 产品 解决什么
推理层 Unweight 张量压缩 前沿 LLM 无损压缩 22%,推理更快更便宜
记忆层 Agent Memory 给 Agent 一个能记住重要事、忘掉不重要事的长期记忆
搜索层 AI Search Agent 专用搜索原语,动态建实例、混合检索
存储层 Artifacts 给 Agent 用的 Git 兼容版本化存储,能创建千万个仓库
执行层 Dynamic Workers 基于 Isolates 的沙箱,毫秒级启动执行 Agent 生成的代码
功能控制 Flagship 亚毫秒级特性开关,专为 AI 时代的灰度发布设计
可观测性 Agent Tracing 每个 Agent turn 的模型调用、工具执行、token 用量全链路追踪
成本/安全 AI Gateway User Insights 组织级 AI 花费可视化 + 异常使用检测
支付 Cloudflare Wallets 给 Agent 一个能自己花钱的钱包(8月4日单独发布)

不是每一项都同等重要。挑几件真正改变游戏规则的说。

Agent Memory:给健忘的 Agent 一个大脑

这一周最关键的发布。

目前绝大多数 Agent 都是「金鱼记忆」——每轮对话结束,上下文就没了。跨会话记住用户偏好、记住之前做过的事、记住哪些信息重要哪些可以忘掉,这些能力几乎没有现成方案。

Cloudflare Agent Memory 是一项托管服务,定位很明确:

让 AI Agent 能够记住重要的信息,忘记不重要的信息,并且随着时间推移变得更聪明。

重点不是「能存」——能存的数据库有一万个。重点是「知道该记什么、该忘什么」。Agent Memory 内置了重要性评分、遗忘曲线、跨会话检索,而不是简单地把所有历史堆进向量库。

对构建真实世界 Agent 的团队来说,这意味着不用再自己写一套记忆管理系统。这跟两年前 Serverless 数据库出现时,团队不再需要自己管扩容是同一个逻辑。

值得注意的是,腾讯云也在差不多的时间开源了 TencentDB Agent Memory,走的是另一条路——四层语义金字塔(L0 原始对话 → L1 原子事实 → L2 场景知识 → L3 用户画像),强调记忆的治理而非存储。两者一个托管、一个开源,面向不同人群。

AI Search 接入三大 Agent 框架

7月30日 Changelog 更新:AI Search 可以直接从主流 Agent 框架调用了。覆盖三个生态:

Vercel AI SDK(ai@^6)——新出了 ai-search-provider npm 包,把 instance.chat() 传给 generateTextstreamText,返回结果直接带检索到的 sources,也可以把 instance.search() 暴露成 Agent loop 里的一个 tool。

LangChain——langchain-cloudflare 包新增了 CloudflareAISearchRetriever,标准 LangChain Retriever 接口。单独用、包一层 create_retriever_tool 当 Agent 搜索工具、丢进 RAG chain 里都行。

Cloudflare Agents SDK——新增完整指南,教你做一个有状态聊天 Agent,自己创建搜索实例、自己索引内容、再通过 tool 调用去搜索。

这件事的意义不在于多了三个 SDK,而在于 RAG 的「检索」这一步,终于从手动调 REST API 变成了 Agent 框架里的一等公民。

Dynamic Workers:Agent 生成的代码有地方跑了

4月13日进入公开测试的 Dynamic Workers,到 Agents Week 已经配套了完整的工具链。

它解决的问题是:AI Agent 生成的代码,你到底放哪儿执行?

大多数团队现在用容器。但容器启动慢、内存占用大,为了避免冷启动你又得预热容器池,结果多个任务复用同一个容器,隔离性被削弱。

Cloudflare 的方案是 V8 Isolates——Chrome 浏览器用的沙箱技术,也是 Cloudflare Workers 跑了八年的底层。官方数据:Isolates 数毫秒启动,只占几 MB 内存,启动速度比容器快约 100 倍,内存效率高 10-100 倍。

这意味着你可以为每一段 Agent 生成的代码,按需创建一个全新的 Isolate,执行完立刻销毁,不复用。 不复用,就没有跨任务的状态泄漏。

配套的三个 npm 库已可用:@cloudflare/codemode(简化 AI 工具生成代码的运行)、@cloudflare/worker-bundler(运行时 npm 依赖解析与打包)、@cloudflare/shell(虚拟文件系统,支持事务批量写入、SQLite/R2 持久化)。

这个方向跟 Cloudflare 之前提出的 Code Mode 理念一脉相承:AI Agent 不应该一轮一轮调工具 API,而应该直接写强类型代码完成任务。Cloudflare 自己的数据——把 MCP 服务器转成 TypeScript API 让 Agent 写代码,相比传统工具调用模式,Token 消耗减少了 81%。

Unweight:无损压缩 22%

在边缘网络上跑大模型,最大的瓶颈不是算力不够,而是 GPU 内存带宽——把模型权重从显存喂到计算单元的那条路,堵了。

Unweight 是一个无损推理时点压缩系统:在不损失精度的前提下,把前沿 LLM 的体积减小高达 22%。不是精度换速度的 trade-off,是无损。同样的显存可以放更大的模型,或者同样的模型推理更快、更便宜。

这种基础设施层面的优化,用户不会直接看到一个新按钮,但会通过 Workers AI 的定价和延迟间接惠及每一个跑在 Cloudflare 上的 Agent。

可观测性:终于能看清 Agent 在干什么

8月4日和5日连续两条更新,是 Agent 从玩具走向生产的最后一块拼图。

Agent Tracing——用 Agents SDK 构建的应用现在可以开启 Trace,每个 Agent turn 完整记录模型调用、工具运行、人工审批、token 用量、Workers 运行时操作。Wrangler 配置里打开 observability.traces.enabled = true 就有。

AI Gateway User Insights——成本失控是团队上 AI 应用最怕的事。User Insights 基于每个用户过去 30 天 p95 会话成本做基线,超出基线 + 超出组织级阈值的会话会被标出来——凭据泄露或 Agent 跑飞,往往先表现为某个用户的花费突然跳涨。与 Cloudflare Access 集成后,认证后的用户 ID 直接带进日志、路由、花费控制,不用在客户端代码里手动传 user_id。

不是产品列表,是一张正在成型的栈

把这些产品放在一起看,Cloudflare 画的图很清楚:

Agent 需要什么 Cloudflare 给什么
记住事情 Agent Memory
搜索知识 AI Search
存代码和数据 Artifacts
执行生成的代码 Dynamic Workers
跑模型 Workers AI + Unweight
花钱买东西 Cloudflare Wallets
看清自己在干什么 Agent Tracing + AI Gateway
控制成本和安全 User Insights + Access

每一层都是托管服务,不需要你管服务器。 组件之间走内网,延迟低、没有跨云带宽费。

这不是把几个独立产品摆在一起,是从 Agent 的需求倒推出来的一张完整的栈——这张栈的每一个组件都跑在同一张全球边缘网络上。

诚实的问题

Cloudflare 的优势和短板同样明显:

  • 优势:边缘位置带来的低延迟、Serverless 粒度的按量付费、整条链路统一的身份和安全模型、没有冷启动负担
  • 短板:Workers AI 的模型目录还是精选制(50+ 模型),跟 AWS/Azure 那种几百个模型的市场不能比;Agent Memory 是新服务,SLA 和性能数据需要时间验证;Dynamic Workers 目前还是公测,面向付费 Workers 用户

另外绕不开的是 Isolates 沙箱的安全边界。Cloudflare 自己承认:基于 V8 Isolates 的沙箱,攻击面比硬件虚拟机更复杂,V8 漏洞比 hypervisor 漏洞更常见。应对措施包括几小时内把 V8 安全补丁部署到生产、自定义二级沙箱、MPK 硬件级防护、跟学术研究者合作的新型 Spectre 防御。对绝大多数非国家级对抗场景够用,但处理最高机密级别数据时可能还是倾向于硬件级隔离的传统 VM。

写在最后

Agents Week 2026 最值得记住的,不是任何一个单独的产品,而是 Cloudflare 开始用一个统一的视角回答一个问题:当 AI Agent 成为互联网的主要用户,基础设施该怎么变?

过去十年的云计算,围绕「人类用户 + 移动端 + Web 应用」设计。下一个十年,会围绕「AI Agent + 边缘 + 有状态交互」重新设计。计算要跑到离 Agent 最近的地方,计费要细到毫秒,代码执行环境要能按需创建即时销毁,安全模型要从「防人」扩展到「防 Agent 生成的代码」。

谁先为 Agent 造好云,谁就吃下下一个十年的增量。

参考链接:

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板