2026 年 6 月 26 日,OpenAI 发布 GPT-5.6 系列。三个模型,三个定位,一个争议。
旗舰级 Sol 在 Terminal-Bench 2.1 上跑出了 91.9% 的成绩,超过 Claude Mythos 5 的 88.0%——这是 OpenAI 在 Agent 基准上首次明确超越 Anthropic 的旗舰。但就在同一天,OpenAI 宣布:应美国政府要求,Sol 仅向有限可信合作伙伴开放预览,首批约 20 家企业获权。
性能登顶和限量开放同时发生,这件事比任何跑分数字都更值得深入分析。
三档模型规格对比
GPT-5.6 系列首次采用三档命名策略:Sol(旗舰)、Terra(均衡)、Luna(轻量)。
| 维度 | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna |
|---|---|---|---|
| 定位 | 旗舰级,复杂推理/科研/Agent | 均衡型,日常开发 | 轻量快速,在线服务 |
| 输入定价 | $5 / 百万 token | 未公布(预计约 $2-3) | 未公布(预计约 $0.5-1) |
| 输出定价 | $30 / 百万 token | 未公布(预计约 $10-15) | 未公布(预计约 $2-4) |
| vs 前代 | 新模型 | 性能接近 GPT-5.5,成本降约 50% | 速度优先 |
| Max 模式 | 更长时间思考 | 不支持 | 不支持 |
| Ultra 模式 | 协调多个子 Agent | 不支持 | 不支持 |
| 可用范围 | 仅限可信合作伙伴预览 | 预计全面开放 | 预计全面开放 |
关键信息:Sol 的定价约为 Claude Fable 5 的一半。 Claude Fable 5 的输入定价约 $10 / 百万 token,输出约 $60 / 百万 token。Sol 以 $5/$30 的价格提供更强的 Agent 能力——这是 OpenAI 在价格战中的明确信号。
Terminal-Bench 2.1:Sol 的里程碑成绩
Terminal-Bench 是目前最权威的 Agent 自主编程基准测试,评测模型在没有人类干预的情况下完成真实编程任务的能力。
| 模型 | Terminal-Bench 2.1 成绩 |
|---|---|
| GPT-5.6 Sol Ultra | 91.9% |
| GPT-5.6 Sol | 88.8% |
| Claude Mythos 5 | 88.0% |
| Claude Fable 5 | 84.3% |
| GPT-5.5 | 83.4%(Codex CLI harness) |
Sol Ultra 的 91.9% 是当前最高分。 Ultra 模式让 Sol 协调多个子 Agent 完成复杂长期任务——这和 Anthropic 的 Dynamic Workflows(数百并行子 Agent)是同一个赛道上的竞争。
但需要注意:
- Ultra 模式是增强版,不是标准版。 88.8% 的标准 Sol 和 88.0% 的 Claude Mythos 5差距只有 0.8 个百分点——这个差距在统计上是否显著,取决于评测样本量。
- 评测 harness 不同。 OpenAI 的脚注提到 GPT-5.5 用的是 Codex CLI harness,而 Sol 和 Claude 用的是 Terminus-2 public harness。不同 harness 可能影响结果。
- Terminal-Bench 还在演化。 2.1 版本比 2.0 有调整,未来版本可能改变排名。
和前代 GPT-5.5 相比,Sol 的提升是实质性的——不只是跑分高了几个百分点,而是首次在 Agent 自主完成任务这个关键指标上超越了 Claude Opus 4.8 系列的旗舰。
ExploitBench:网络安全的新标杆
ExploitBench 是评估模型自主发现和利用软件漏洞能力的基准。这个领域特别敏感——能力强意味着模型可以被用来发现漏洞(好事),也可以被用来制造攻击(坏事)。
| 模型 | ExploitBench 表现 |
|---|---|
| GPT-5.6 Sol | 约 Anthropic Mythos Preview 水平,但用约 1/3 输出 token |
| Anthropic Mythos Preview | 基线水平 |
| 其他模型 | 未公布详细对比 |
Sol 用 1/3 的 token 达到了 Mythos Preview 水平。 这意味着 Sol 在网络安全任务上更高效——同样结果,成本更低。但这也正是 Sol 被限量开放的原因之一。
安全评估:未达最高风险等级,但已经足够危险
OpenAI 的安全评估报告(通常在 system card 中公布)显示:
| 安全维度 | Sol 评估结果 |
|---|---|
| 漏洞发现 | 能识别 Chromium/Firefox 漏洞 |
| 漏洞利用 | 未自主生成完整利用链 |
| 生物研究风险 | 有提升但未全面超越前代 |
| 自主行动能力 | 显著提升(Ultra 模式) |
| 最高风险等级 | 尚未达到 |
关键判断:Sol 能识别漏洞但未自主生成完整利用链。 这是 OpenAI 决定「限量开放而不是完全不开放」的依据——模型还不够危险到需要完全封锁,但已经足够危险到不能让任何人随便用。
这个判断是否合理?取决于你对「足够危险」的定义边界。能识别 Chromium 漏洞意味着模型可以帮安全研究员做好事,也意味着它可以帮攻击者定位目标。区别在于意图,而不在于能力。
美国政府审查:限量开放的深层含义
这是这次发布中最值得关注的部分。
OpenAI 在公告中明确写道:
At the direction of the US government, GPT-5.6 Sol is available only to a limited set of trusted partners for preview. Approximately 20 organizations have been granted initial access.
同时,OpenAI 也公开表态:
We believe that a government-approval process for AI models should not become the long-term default mode for the industry.
这两句话的矛盾是显而易见的:OpenAI 在执行政府审查的同时,公开反对政府审查成为长期模式。
这意味着什么?
- 政府审查已经在发生。 不是「可能发生」或「正在讨论」,而是「已经发生了,并且 OpenAI 在执行」。这是 AI 行业的重大转折点。
- OpenAI 不完全认同这个审查。 公开表态「不应成为长期默认」是一种政治姿态——既服从当前要求,又为未来争取更宽松的规则。
- 约 20 家企业首批获权。 这意味着绝大多数开发者和企业无法使用 Sol,至少在短期内。对依赖 OpenAI API 的团队来说,这是一个实质性的供应限制。
与 GPT-5.4 发布时的对比
GPT-5.4 发布时,没有政府审查限制。从 5.4 到 5.6,中间只隔了两代,但政策环境已经发生了根本变化。这说明 AI 模型的能力增长速度超过了政策制定速度——政府正在用「限量开放」作为临时措施,同时 longer-term 的监管框架还在制定中。
GeneBench 和 HealthBench:生物领域有进步但未全面超越
Sol 在生物领域的评估结果比较微妙:
| 基准 | Sol 表现 |
|---|---|
| GeneBench v1 | 有提升,但提升幅度不如 Agent 基准那么显著 |
| HealthBench | 有提升,但未全面超越前代 |
这符合预期。Agent 编程和网络安全是 Sol 的强项,生物研究不是。 一个模型的能力增长通常不是均匀的——Sol 在 Agent 自主行动方面投入了大量训练资源,在生物领域可能没有特别加强。
这也解释了为什么政府审查集中在 Sol 的网络安全和自主行动能力上——生物领域还没有达到让监管者紧张的水平。
Cerebras 硬件加速:750 token/秒
OpenAI 同时宣布,Cerebras 硬件将在 7 月部署 Sol,推理速度达到 750 token/秒。
| 推理平台 | Sol 推理速度 |
|---|---|
| Cerebras(7 月部署) | 750 token/秒 |
| 标准 GPU 推理 | 约 50-100 token/秒 |
| Claude Mythos 5(标准) | 约 60-80 token/秒 |
750 token/秒是什么概念?一个 1000 token 的回复,Cerebras 上约 1.3 秒完成。 在标准 GPU 上,同样的回复需要 10-20 秒。
但这只是推理速度,不是端到端响应时间。Ultra 模式需要协调多个子 Agent,每个子 Agent 的推理是串行的,总响应时间可能远超单次推理。
对 Gemini 3.5 的用户来说,Cerebras 加速后的 Sol 在速度上可能形成明显优势——但前提是你能获得 Sol 的访问权限。
与竞品的定位对比
| 维度 | GPT-5.6 Sol | Claude Mythos 5 | Gemini 3.5 Pro | Kimi K2-7 Code |
|---|---|---|---|---|
| Agent 基准 | 91.9%(最高) | 88.0% | 未公布详细 | 有成绩但较低 |
| 输入定价 | $5/M | ~$10/M | ~$1.25/M | 免费/低价 |
| 输出定价 | $30/M | ~$60/M | ~$5/M | 免费/低价 |
| 政府审查 | 限量开放 | Project Glasswing 限量 | 无限制 | 无限制 |
| 子 Agent 协调 | Ultra 模式 | Dynamic Workflows | 未明确 | 未明确 |
| 网络安全能力 | 强(限量原因之一) | Mythos Preview 限量 | 一般 | 一般 |
Sol 的优势在 Agent 能力和价格,劣势在可用性。 你可以花一半的钱得到更强的 Agent 能力,但你可能根本拿不到访问权限。
行业影响:三重信号
信号一:Agent 基准成为新的竞争焦点
Terminal-Bench 和 ExploitBench 正在取代 MMLU 和 gsm8k 成为旗舰模型的关键指标。这说明行业正在从「模型能不能答对题」转向「模型能不能自主完成任务」。 OpenAI 和 Anthropic 都在 Agent 基准上投入了大量资源,这个趋势会持续加速。
信号二:政府审查成为新的变量
从 GPT-5.4 到 GPT-5.6,政府审查从零到有限制,只用了两代模型的时间。如果 Sol 的限量开放成为常态化,AI 行业将进入一个「许可证时代」——最强模型只有少数被审批的机构能用。 这对开源生态和中小企业都不是好消息。
信号三:定价战加速
Sol 的 $5/$30 定价是 OpenAI 在价格上的明确攻击——同样能力,Anthropic 收两倍。如果 Terra 和 Luna 的定价也保持低水平,OpenAI 可能通过价格战在全面开放的档位上抢夺市场份额,同时用 Sol 的限量开放维持旗舰叙事。
写在最后
GPT-5.6 系列发布,表面上是技术升级,实质上是行业格局的三重转折:Agent 基准登顶、政府审查介入、定价战升级。
Sol 在 Terminal-Bench 上超越 Claude Mythos 5 是事实,但「约 20 家企业首批获权」也是事实。最强模型限量开放,这意味着绝大多数开发者今天无法验证 OpenAI 的跑分声明——你只能相信公告里的数字,而不能自己跑一遍。
OpenAI 公开表态「政府审批不应成为长期默认」是一种姿态,但姿态和行动是两回事。真正的问题是:如果 Sol 的限量开放持续 6 个月、12 个月、甚至更久,这个「临时措施」是否已经事实上变成了「长期默认」?
OpenAI 官方公告:openai.com/blog/gpt-5-6