7 月 20 日,月之暗面发了一则公告:暂停 C 端新用户订阅。原因不是商业策略调整,而是算力被自己打爆了——Kimi K3 上线 48 小时,用户请求量逼近算力上限。
这是 AI 行业第一次出现「模型太火导致公司被迫停止卖会员」的情况。三天前(7 月 17 日),Kimi K3 正式发布:2.8 万亿参数、Stable LatentMoE 架构、1M 上下文、原生视觉理解、完整权重开源。SWE Marathon 编码基准 42.0 分,超过 Claude Fable 5 的 35.0 和 GPT-5.6 Sol 的 39.0。
一个开源模型,发布三天就把自己的服务器跑满了。这不是营销事故,是产品力的证明。
核心规格
| 维度 | Kimi K3 |
|---|---|
| 发布日期 | 2026 年 7 月 17 日 |
| 总参数量 | 2.8 万亿(2.8T) |
| 架构 | Stable LatentMoE(896 专家,每次激活 16) |
| 上下文窗口 | 1M tokens |
| 多模态 | 原生视觉理解 |
| 开源状态 | 权重开放(7 月 27 日前完整释放) |
| 训练精度 | 权重 MXFP4,激活 MXFP8 |
| 部署建议 | ≥64 加速器(supernode) |
| 相对 K2 扩展效率 | ~2.5 倍 |
2.8T 参数让 Kimi K3 成为当前全球最大的开源模型,超过 Qwen 3.8 Max(2.4T)和 GLM-5.2(744B)。但关键不是参数量,而是架构创新——Stable LatentMoE 用 896 个专家中每次只激活 16 个的方式,在 2.8T 总参数下控制了推理成本。
基准测试:编码第一,综合逼近闭源顶级
Kimi K3 在编码和 Agent 基准上的表现是这次发布最核心的亮点:
| 基准 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Opus 4.8 |
|---|---|---|---|---|
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 |
| CodeArena ELO | 1679 | 1631 | 1618 | — |
| Terminal-Bench 2.1 | 88.3 | — | — | — |
| BrowseComp | 91.2 | — | — | — |
| SpreadsheetBench 2 | 34.8 | — | — | — |
| ProgramBench | 77.8 | — | — | — |
SWE Marathon 42.0 意味着什么?这个基准测试的是长时间、多步骤的真实软件工程任务——不是写一个函数,而是完成一个完整的工程需求。K3 在这个维度超过了所有闭源模型,包括被封禁前被称为「史上最强」的 Fable 5。
但综合智能维度(Artificial Analysis 指数),K3 得分 57,仍低于 Fable 5 的 60 和 GPT-5.6 Sol 的 59。编码最强不等于全能最强——这个区分很重要。
API 定价:贵但有效
| 计费项 | 价格 |
|---|---|
| 缓存命中输入 | $0.30 / 百万 tokens(~2 元) |
| 未命中输入 | $3.00 / 百万 tokens(~20 元) |
| 输出 | $15.00 / 百万 tokens(~100 元) |
对比 K2.5,输入费用提高约 5 倍,输出费用接近 5 倍。但编码场景缓存命中率超过 90%,实际成本远低于标价。第三方测算:单任务平均成本约 $0.94,低于 Opus 4.8 的 ~$1.80。
与 Hy3 正式版(输入 1 元/百万、输出 4 元/百万)相比,K3 贵了一个量级。但 Hy3 是 295B,K3 是 2.8T——不在同一个能力层级。
产品接入:WorkBuddy 已可用,TRAE Work CN 需会员
K3 发布后,各平台的接入速度很快:
| 平台 | 接入状态 | 使用门槛 |
|---|---|---|
| WorkBuddy(腾讯) | 已上线,Buddy 全系接入 | 可直接使用 |
| CodeBuddy(腾讯) | 已上线 | 企业版/订阅用户优先,逐步开放 |
| TRAE Work CN(字节) | 已上线 | 需开通会员 |
| Kimi 官方 | 已上线 | 7.20 起暂停新订阅 |
| Qoder CN(阿里) | 待确认 | — |
腾讯 Buddy 全系产品在 K3 发布当天即完成接入,WorkBuddy 用户可直接在模型选择器中切换使用。CodeBuddy 当前向企业专享版和个人订阅用户优先开放,高峰时段可能排队。
字节的 TRAE Work CN 同样接入了 K3,但需要开通会员才能使用——免费用户无法调用。这与 TRAE CN「完全免费」的品牌定位形成了微妙矛盾:IDE 免费,但最好的模型要付费。
Kimi 官方则因为算力紧张,在 7 月 20 日宣布暂停 C 端新用户订阅,保障已订阅用户权益。月之暗面致歉并表示正在扩容。
算力危机:开源模型的甜蜜烦恼
暂停订阅事件的本质是:开源模型的推理成本由谁承担?
闭源模型(Fable 5、GPT-5.6)的推理成本由 API 调用费覆盖——用多少付多少,算力弹性伸缩。但 Kimi K3 的 C 端产品(kimi.com)是订阅制——用户付固定月费,不限量使用。当 K3 的推理成本远高于 K2.5 时,同样的订阅费覆盖不了同样的使用量。
| 模式 | 代表 | 算力风险 |
|---|---|---|
| API 按量计费 | Fable 5、GPT-5.6 | 低(成本转嫁给调用者) |
| 订阅制 + 自有模型 | Kimi K3 C 端 | 高(固定收入 vs 弹性成本) |
| 平台内嵌 + 积分制 | WorkBuddy、CodeBuddy | 中(积分控制用量) |
月之暗面的选择是:暂停新增订阅,保住存量用户体验。这是短期止血,长期必须解决推理成本问题——要么涨价,要么限流,要么等开源社区把推理效率优化上来。
开源意义:3T 时代的开端
Kimi K3 的开源(权重 7 月 27 日前完整释放)把开源模型的参数规模推到了 3T 级别。这对行业的影响:
| 维度 | K3 之前 | K3 之后 |
|---|---|---|
| 开源最大模型 | Qwen 3.8 Max 2.4T(不开源)/ GLM-5.2 744B | K3 2.8T(开源) |
| 编码 SOTA | 闭源(Fable 5) | 开源(K3) |
| 私有化部署天花板 | 744B(GLM-5.2) | 2.8T(需 ≥64 卡) |
| 微调可能性 | 限于 744B 以下 | 扩展到 2.8T |
编码基准第一次由开源模型拿下第一——这在一年前不可想象。当 K3 的 SWE Marathon 超过 Fable 5 时,「开源不如闭源」的叙事在编码领域已经失效。
但 2.8T 的部署门槛(≥64 加速器)意味着:大部分企业仍然无法私有化部署 K3。开源的价值更多体现在研究、微调和 API 生态上,而非「下载下来自己跑」。
写在最后
Kimi K3 的三天故事——发布、爆火、暂停订阅——是 2026 年 AI 行业的一个缩影:模型能力已经跑到了基础设施前面。2.8T 参数、编码第一、开源——每一个标签都足以引爆需求,而算力供给跟不上需求爆发。
K3 暂停订阅不是失败,是成功的代价。当用户用脚投票把你的服务器跑满时,你唯一的问题是「怎么扩容」,而不是「怎么获客」。这是所有 AI 公司梦寐以求的困境。