8 月 13 日,DeepSeek 宣布 V4 全系列模型正式版上线。这不是一次预览,而是正式的产品化落地——APP、网页客户端、开发者 API 同步更新,同时带来计费体系的重大调整。
V4-Pro 强化 Agent 智能体能力,原生支持 OpenAI Responses API,全面适配 Codex 开发工具。V4-Flash 则传来更震撼的消息:模型结构和尺寸与预览版完全一致,仅通过后训练就把 DeepSWE 得分从 7.3 提升到 54.4——涨幅超过 640%。
当后训练的"魔法"能让一个 200B 模型在小参数下反超大参数,AI 竞争的焦点就从"谁参数更多"转向了"谁更会调教"。
V4-Pro 正式版:Agent 能力的代际跨越
V4-Pro 正式版(版本号 0813)的核心升级集中在三个维度:
1. Agent 与代码能力
在代码智能体、工具调用、长链路任务执行等公开基准测试中性能显著提升。依托 DeepSeek Harness 极简测试框架完成专项优化,更适配自动化开发、复杂任务编排场景。
2. Responses API + Codex 适配
原生支持 OpenAI 标准 Responses API,针对性适配 Codex 开发工具——开发者可通过官方脚本一键完成接入配置。这解决了大模型开发中长期存在的 JSON 格式解析失败问题,Agent 框架的集成成本大幅降低。
3. 三档思考强度
V4-Pro 和 V4-Flash 均新增 low / high / max 三档思考强度调节:
| 档位 | 适用场景 | Token 消耗 |
|---|---|---|
| low | 简单问答、分类 | 最少 |
| high | 中等推理、代码辅助 | 适中 |
| max | 复杂代码、多步推理、Agent 任务 | 最高 |
用户可根据任务复杂度灵活匹配,简单任务用 low 节省算力,复杂任务用 max 拉满思考深度。
V4-Flash:后训练的"魔法"
如果说 V4-Pro 是稳步升级,那 V4-Flash 正式版就是一次"不可思议"的跨越。
DeepSeek 特别注明:V4-Flash 的模型结构和尺寸与预览版完全一致(284B 总参数、13B 激活参数),仅重新进行了后训练。换言之,没有任何架构创新,仅靠"调教"就让性能发生了质变。
| 基准 | 预览版 | 正式版 | 涨幅 |
|---|---|---|---|
| DeepSWE | 7.3 | 54.4 | +644% |
| 综合 Agent 得分 | 基线 | 25.2 | 逼近 Claude Opus 4.8 |
| 终端操作 | 低分 | 大幅跃升 | — |
| 网络攻防 | 低分 | 大幅跃升 | — |
| 工具调用 | 低分 | 大幅跃升 | — |
这个跨越式的性能提升关键,在于当前大模型领域最核心的技术——后训练(Post-training)。精细化强化学习 + 高质量数据重训,让工具调用和代码开发能力实现了质的变。
Flash 的关键优势
- 低成本:原生支持 100 万 Token 超长上下文,算力消耗仅为前代 V3.2 的 27%,显存占用降至 10%
- 高速度:每层 256 个专家仅激活 6 个,独创并行策略打破单机 8 卡限制
- 全兼容:兼容 OpenAI 和 Anthropic 双 API 接口
- 去 CUDA 化:全部核心算子基于 Triton 自研,脱离英伟达 CUDA 生态,国产 GPU 可直接部署
峰谷定价:8 月 17 日起生效
随正式版上线,DeepSeek 同步调整了 API 定价策略:
| 维度 | 详情 |
|---|---|
| 生效时间 | 2026 年 8 月 17 日 0 时 |
| 覆盖模型 | V4-Pro、V4-Flash |
| 高峰时段 | 每日 9:00-12、14:00-18(北京时间) |
| 定价规则 | 高峰时段价格为闲时的 2 倍 |
| 目的 | 通过价格杠杆分流错峰调用 |
这是一次明确的价格信号:DeepSeek 的算力资源在高峰时段已经接近满载,需要用价格来调节需求。对于普通用户影响不大——APP 和网页端自动使用新版模型,无需额外操作。但对于 API 开发者,这意味着高并发任务如果能在闲时(18 次日 9)运行,成本可以减半。
双模型定位:防弹车 vs 日常用车
| 维度 | V4-Pro | V4-Flash |
|---|---|---|
| 参数规模 | 1.6T(49B 激活) | 284B(13B 激活) |
| 定位 | 企业级复杂科研、重度开发 | 高性价比日常使用 |
| 上下文 | 1M | 1M |
| 价格区间 | 旗舰定价 | 免费 ~ 极低价 |
| 比喻 | 专业防弹车 | 日常用车 |
V4-Pro 解决最难的题,V4-Flash 服务最多的人。两者的组合覆盖了从企业级到个人开发者的完整光谱。
行业影响
1. 后训练成为新战场。 V4-Flash 用同一个模型通过后训练实现 640% 的性能飞跃,证明"架构 + 训练方法"的组合比单纯堆参数更重要。这会给其他模型厂商带来巨大的后训练研发压力。
2. 峰谷定价是大模型成熟化的标志。 当算力需求足够大、用户足够多时,价格机制就成为必要的资源调配工具。DeepSeek 的峰谷定价意味着它已经达到了"算不过来"的规模——这是商业成功的另一种体现。
3. 开发者工具的生态整合。 Responses API + Codex 适配不是技术升级,而是生态信号。DeepSeek 正在主动降低开发者的接入成本,让更多 Agent 框架能无缝集成 V4 系列。
V4 正式版的意义不仅在于模型能力本身,更在于它验证了一个方法论:当后训练能做到"化腐朽为神奇"时,AI 竞争的焦点就从"谁的模型更大"转向了"谁的调教更精"。DeepSeek 在后训练上找到的"不二法门",可能会成为接下来半年全行业的研究方向。