7 月 31 日,DeepSeek 开放 V4-Flash 正式版 API 公测。8 月 3 日,Artificial Analysis 发布基准报告:V4-Flash 单任务平均成本 0.03 美元,是当前全球主流大模型中最低,约为 Claude Fable 5 的 1/105。
3 美分,约合人民币 2 毛钱。这个价格让"AI 太贵"不再是大多数场景的拦路虎。
如果你读过 V4-Pro 预览版分析,会记得 DeepSeek 的双模型策略:Pro 打精度,Flash 打吞吐。V4-Flash 正式版是这个策略的下半场——当 Pro 已经在代码基准上超越所有闭源模型时,Flash 要解决的是"让 AI 跑得起"的问题。同期 Qwen3.8-Max 正式版 也在 8 月 3 日发布,国产大模型进入密集发布期。
关键信息
| 维度 | 值 |
|---|---|
| 总参数 / 激活参数 | 2840 亿 / 130 亿 |
| 架构 | MoE,Hybrid Attention |
| 上下文 | 1M tokens |
| 开源协议 | Apache 2.0 |
| 输入价格 | $0.14 / M tokens |
| 输出价格 | $0.28 / M tokens |
| 单任务平均成本 | $0.03(Artificial Analysis 测算) |
| 智能指数 | 50(vs GPT-5.6 Luna 的 51) |
| 本地运行 | Unsloth 发布于 4 小时 54 分后 |
3 美分是怎么来的
Artificial Analysis 的"单任务成本"不是简单的 token 单价换算,而是用一组标准任务跑完整流程后计算的总花费。V4-Flash 能把单任务压到 3 美分,是三个因素叠加的结果:
激活参数极少。 2840 亿总参数,但每次推理只激活 130 亿——激活率 4.6%。这意味着模型容量大(知识储备丰富),但推理时算力消耗低。对比 V4-Pro 的 49B 激活,Flash 的激活量只有其 1/4。
Hybrid Attention 的长上下文压缩。 这是从 V4 继承的架构创新:CSA + HCA 把 1M 上下文的 KV 缓存压到 V3.2 的 7%。长上下文不再吃显存,推理成本随之下降。
定价策略激进。 $0.14/$028 per M token 的定价,本身就是同级模型中最低。再加上 60% 以上的任务能在 Flash 的能力范围内完成,综合成本就被压到了美分量级。
价格低不等于能力低。Artificial Analysis 智能指数 50 分,和 OpenAI GPT-5.6 Luna 的 51 分只差 1 分。这 1 分的差距,对应的是 1/105 的成本差。
4 小时 54 分:Unsloth 的本地化竞速
V4-Flash 正式版发布后 4 小时 54 分,Unsloth 就推出了本地运行版本。这个速度本身就值得说。
Unsloth 是专门做大模型本地化优化的团队。他们对 V4-Flash 做的是量化 + 推理优化,让这个 2840 亿参数的模型在消费级硬件上也能跑。具体配置和性能数据需要看 Unsloth 的发布说明,但"4 小时 54 分"这个数字说明两件事:
- DeepSeek 的开源质量高。 模型权重、推理代码、技术文档齐全,Unsloth 才能在几小时内完成本地化适配。如果开源质量差,这个时间会是几天甚至几周。
- 社区对 V4-Flash 的关注度极高。 Unsloth 不会为一个没人关心的模型投入这种响应速度。
和 V4-Pro 的定位差异
| 维度 | V4-Pro | V4-Flash |
|---|---|---|
| 总参数 / 激活 | 1.6T / 49B | 284B / 13B |
| 定位 | 旗舰推理 | 高性价比 |
| 输出价格 | $3.48/M | $0.28/M |
| 代码基准 | 全面超越闭源 | 多数基准差 Pro 1-2 分 |
| 适用场景 | 极限推理、复杂 Agent | 高吞吐、批量任务 |
Flash 不是 Pro 的裁剪版,是独立训练的 MoE 模型。多数基准和 Pro 只差 1-2 分,但 API 成本降低约 12 倍。这种分档思路类似 Claude 的 Sonnet/Opus——高端打精度,Flash 打吞吐。
局限:便宜不等于万能
智能指数 50 ≠ 通用能力 50。 Artificial Analysis 的指数是综合评分,V4-Flash 在简单任务上可能接近 Pro,但在复杂推理、长程 Agent、极限代码任务上,和 Pro 的差距会大于 1-2 分。
1M 上下文的检索衰减仍存在。 V4-Pro 在 1M 上下文下检索准确率 0.66,Flash 作为更小的模型,这个数字只会更低。"支持 1M"和"1M 好用"之间仍有距离。
本地运行的性能损耗。 Unsloth 的本地版本虽然能跑,但量化后的精度损失、消费级硬件的吞吐限制,意味着本地体验和 API 调用不在一个量级。本地运行更适合隐私敏感场景,不适合生产环境。
没有多模态。 和 V4-Pro 一样,V4-Flash 目前是纯文本。多模态要等 V4-VL 单独发布。
行业影响
"3 美分"会重塑 AI 应用的经济学。 当一个任务的 AI 成本降到 3 美分,很多原本"用 AI 不划算"的场景突然变得划算了——批量内容审核、大规模数据清洗、个性化推荐解释、实时客服质检。这些场景过去因为成本问题无法规模化,现在可以了。
倒逼闭源模型降价。 V4-Flash 的定价和性能组合,直接对标 OpenAI 的 Luna 和 Anthropic 的 Sonnet。Artificial Analysis 报告指出,V4-Flash 比降价后的 Luna 还低 60%。闭源模型要么降价,要么在能力上拉开明显差距——后者越来越难。
开源模型的"发布即本地化"成为新标准。 Unsloth 4 小时 54 分的响应速度,说明开源模型的本地化生态已经非常成熟。未来任何旗舰开源模型发布,社区都会在几小时内推出本地运行方案。这进一步削弱了闭源模型的"便利性"优势。
结论
DeepSeek-V4-Flash 正式版不是一次能力突破,而是一次经济突破。它用 2840 亿参数、130 亿激活、$0.03 单任务成本,证明了 AI 推理可以便宜到让大多数应用场景不再犹豫。
当 V4-Pro 在代码基准上超越所有闭源模型时,问题是"开源能不能追上闭源"。当 V4-Flash 把单任务成本压到 3 美分时,问题变成了"闭源凭什么收 100 倍的钱"。
- DeepSeek 官网:deepseek.com
- Artificial Analysis 报告:artificialanalysis.ai