跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.07.20 · 11 min

Kimi K3 发布 3 天即暂停订阅:2.8 万亿参数开源模型,算力被自己打爆了

2026 年 7 月 17 日月之暗面发布 Kimi K3,2.8 万亿参数 Stable LatentMoE,1M 上下文,SWE Marathon 42.0 超越 Claude Fable 5。上线 48 小时算力告急,7 月 20 日暂停新用户订阅。腾讯 Buddy 全系已接入,WorkBuddy 可直接使用。

前沿动态

7 月 20 日,月之暗面发了一则公告:暂停 C 端新用户订阅。原因不是商业策略调整,而是算力被自己打爆了——Kimi K3 上线 48 小时,用户请求量逼近算力上限。

这是 AI 行业第一次出现「模型太火导致公司被迫停止卖会员」的情况。三天前(7 月 17 日),Kimi K3 正式发布:2.8 万亿参数、Stable LatentMoE 架构、1M 上下文、原生视觉理解、完整权重开源。SWE Marathon 编码基准 42.0 分,超过 Claude Fable 5 的 35.0 和 GPT-5.6 Sol 的 39.0。

一个开源模型,发布三天就把自己的服务器跑满了。这不是营销事故,是产品力的证明。

核心规格

维度 Kimi K3
发布日期 2026 年 7 月 17 日
总参数量 2.8 万亿(2.8T)
架构 Stable LatentMoE(896 专家,每次激活 16)
上下文窗口 1M tokens
多模态 原生视觉理解
开源状态 权重开放(7 月 27 日前完整释放)
训练精度 权重 MXFP4,激活 MXFP8
部署建议 ≥64 加速器(supernode)
相对 K2 扩展效率 ~2.5 倍

2.8T 参数让 Kimi K3 成为当前全球最大的开源模型,超过 Qwen 3.8 Max(2.4T)和 GLM-5.2(744B)。但关键不是参数量,而是架构创新——Stable LatentMoE 用 896 个专家中每次只激活 16 个的方式,在 2.8T 总参数下控制了推理成本。

基准测试:编码第一,综合逼近闭源顶级

Kimi K3 在编码和 Agent 基准上的表现是这次发布最核心的亮点:

基准 Kimi K3 Claude Fable 5 GPT-5.6 Sol Opus 4.8
SWE Marathon 42.0 35.0 39.0 40.0
CodeArena ELO 1679 1631 1618
Terminal-Bench 2.1 88.3
BrowseComp 91.2
SpreadsheetBench 2 34.8
ProgramBench 77.8

SWE Marathon 42.0 意味着什么?这个基准测试的是长时间、多步骤的真实软件工程任务——不是写一个函数,而是完成一个完整的工程需求。K3 在这个维度超过了所有闭源模型,包括被封禁前被称为「史上最强」的 Fable 5。

但综合智能维度(Artificial Analysis 指数),K3 得分 57,仍低于 Fable 5 的 60 和 GPT-5.6 Sol 的 59。编码最强不等于全能最强——这个区分很重要。

API 定价:贵但有效

计费项 价格
缓存命中输入 $0.30 / 百万 tokens(~2 元)
未命中输入 $3.00 / 百万 tokens(~20 元)
输出 $15.00 / 百万 tokens(~100 元)

对比 K2.5,输入费用提高约 5 倍,输出费用接近 5 倍。但编码场景缓存命中率超过 90%,实际成本远低于标价。第三方测算:单任务平均成本约 $0.94,低于 Opus 4.8 的 ~$1.80。

Hy3 正式版(输入 1 元/百万、输出 4 元/百万)相比,K3 贵了一个量级。但 Hy3 是 295B,K3 是 2.8T——不在同一个能力层级。

产品接入:WorkBuddy 已可用,TRAE Work CN 需会员

K3 发布后,各平台的接入速度很快:

平台 接入状态 使用门槛
WorkBuddy(腾讯) 已上线,Buddy 全系接入 可直接使用
CodeBuddy(腾讯) 已上线 企业版/订阅用户优先,逐步开放
TRAE Work CN(字节) 已上线 需开通会员
Kimi 官方 已上线 7.20 起暂停新订阅
Qoder CN(阿里) 待确认

腾讯 Buddy 全系产品在 K3 发布当天即完成接入,WorkBuddy 用户可直接在模型选择器中切换使用。CodeBuddy 当前向企业专享版和个人订阅用户优先开放,高峰时段可能排队。

字节的 TRAE Work CN 同样接入了 K3,但需要开通会员才能使用——免费用户无法调用。这与 TRAE CN「完全免费」的品牌定位形成了微妙矛盾:IDE 免费,但最好的模型要付费。

Kimi 官方则因为算力紧张,在 7 月 20 日宣布暂停 C 端新用户订阅,保障已订阅用户权益。月之暗面致歉并表示正在扩容。

算力危机:开源模型的甜蜜烦恼

暂停订阅事件的本质是:开源模型的推理成本由谁承担?

闭源模型(Fable 5、GPT-5.6)的推理成本由 API 调用费覆盖——用多少付多少,算力弹性伸缩。但 Kimi K3 的 C 端产品(kimi.com)是订阅制——用户付固定月费,不限量使用。当 K3 的推理成本远高于 K2.5 时,同样的订阅费覆盖不了同样的使用量。

模式 代表 算力风险
API 按量计费 Fable 5、GPT-5.6 低(成本转嫁给调用者)
订阅制 + 自有模型 Kimi K3 C 端 (固定收入 vs 弹性成本)
平台内嵌 + 积分制 WorkBuddy、CodeBuddy 中(积分控制用量)

月之暗面的选择是:暂停新增订阅,保住存量用户体验。这是短期止血,长期必须解决推理成本问题——要么涨价,要么限流,要么等开源社区把推理效率优化上来。

开源意义:3T 时代的开端

Kimi K3 的开源(权重 7 月 27 日前完整释放)把开源模型的参数规模推到了 3T 级别。这对行业的影响:

维度 K3 之前 K3 之后
开源最大模型 Qwen 3.8 Max 2.4T(不开源)/ GLM-5.2 744B K3 2.8T(开源)
编码 SOTA 闭源(Fable 5) 开源(K3)
私有化部署天花板 744B(GLM-5.2) 2.8T(需 ≥64 卡)
微调可能性 限于 744B 以下 扩展到 2.8T

编码基准第一次由开源模型拿下第一——这在一年前不可想象。当 K3 的 SWE Marathon 超过 Fable 5 时,「开源不如闭源」的叙事在编码领域已经失效。

但 2.8T 的部署门槛(≥64 加速器)意味着:大部分企业仍然无法私有化部署 K3。开源的价值更多体现在研究、微调和 API 生态上,而非「下载下来自己跑」。

写在最后

Kimi K3 的三天故事——发布、爆火、暂停订阅——是 2026 年 AI 行业的一个缩影:模型能力已经跑到了基础设施前面。2.8T 参数、编码第一、开源——每一个标签都足以引爆需求,而算力供给跟不上需求爆发。

K3 暂停订阅不是失败,是成功的代价。当用户用脚投票把你的服务器跑满时,你唯一的问题是「怎么扩容」,而不是「怎么获客」。这是所有 AI 公司梦寐以求的困境。

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板