跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.07.23 · 10 min

Grok 4.5 发布:xAI 押注编程和性价比,但「Opus 级」这个说法需要打点折扣

xAI 于 2026 年 7 月 8 日发布 Grok 4.5,1.5T 参数 MoE 模型,与 Cursor 联合训练。马斯克称其 Opus 级,定价 $2/$6 per M token 极具攻击性,但实际基准测试有胜有负,不是全面超越。

前沿动态

2026 年 7 月 8 日,xAI 发布了 Grok 4.5——融入 SpaceX、以 600 亿美元收购 Cursor 后的第一个旗舰产品。马斯克将其定位为"Opus 级",声称综合能力与 Claude Opus 4.8 在同一梯队。

但比"Opus 级"这个定性更值得认真看的,是它的定价策略和训练路径。xAI 这次做的事和别人不太一样:它不是想做一个"更好的 Opus",而是想做一个"足够好的 Opus,但便宜得多"。

关键信息

Grok 4.5 基于内部称为 V9 的基础架构,约 1.5T 参数的 MoE 模型,推理速度约 80 TPS。

维度
架构 V9 MoE,约 1.5T 总参数
推理速度 ~80 TPS
上下文 最高 50 万 token(可配置)
定价 输入 $2/M token,输出 $6/M token
Token 效率 约竞品 2 倍
训练硬件 数万张 NVIDIA GB300
训练数据 Cursor 真实开发者会话数据
可用性 Grok Build / Cursor / xAI API

对比 Claude Opus 4.8($15/$75),Grok 4.5 的定价低了 5-10 倍。加上约 2 倍的 token 效率——SWE-Bench Pro 上仅用竞品 1/4 的 token 完成同等任务——综合成本可以拉到 10-20 倍。

和 Cursor 的关系:真正的差异化

Grok 4.5 最值得关注的技术细节不是参数规模或基准分数,而是它的训练数据来源。

xAI 在 2026 年 6 月以 600 亿美元估值收购了 Cursor,Grok 4.5 是整合后的第一个产品。Cursor 的真实开发者会话数据——调试追踪、多文件代码差异、用户纠正模式——被直接纳入了训练流程。

这意味着 Grok 4.5 不是在"做题"式基准上训练的。它学习的样本是真实开发者在真实工程场景中的代码编写、调试、修复闭环。这种区别在 benchmark 上不一定看得出来——SWE-Bench 也是构造出来的测试——但在多步编程任务和复杂 Agent 工作流中会更明显。

马斯克在发布时也说了,xAI 收购 Cursor 的目的就是把这种"workflow-aware"的训练能力纳入模型。Grok 4.5 不是 Cursor 的插件,而是反过来——Cursor 是 Grok 4.5 的训练数据管道。

基准:有胜有负

基准 Grok 4.5 Opus 4.8 结果
DeepSWE 1.0 ✅ 领先 落后 Grok 胜
Terminal-Bench 2.1 ✅ 领先 落后 Grok 胜
DeepSWE 1.1 落后 ✅ 领先 Opus 胜
SWE-Bench Pro 落后 ✅ 领先 Opus 胜
Harvey Legal Agent 🥇 第一 Grok 胜

四场编程基准,两胜两负。Harvey Legal Agent 基准第一名是一个意外结果——主要宣传编程能力的模型,在法律 Agent 上拿了第一。这说明 Grok 4.5 的训练方法在非编程任务上也有不错的泛化能力。

SWE-Bench Pro 上还有一个值得单看的数据:Grok 4.5 平均消耗约 15,954 个输出 token,竞品消耗约 67,020 个。在多步 Agent 场景下,token 效率的优势会直接体现为成本和延迟的降低。

定价策略改变游戏规则

Grok 4.5 真正做对的事情是定价。$2/$6 per M token 加上两倍 token 效率,综合成本不到 Opus 4.8 的十分之一。

对比:

Grok 4.5 Opus 4.8
输入价格 $2/M ~$15/M
输出价格 $6/M ~$75/M
Token 效率 ~2x 基线
综合成本 ~1/10 基线

对于需要大量调用编程 API 的团队来说,这个价差直接决定了能不能跑一些原来太贵的场景——比如批量代码审查、大规模的 Agent 工作流、持续集成中的代码分析。

马斯克自己说了一句值得注意的话:

"性能还没到(别尬吹),但其实大多数任务并不需要那么高的性能。"

这是罕见的克制。Grok 4.5 不需要在所有维度上击败 Opus——它只需要在编程和 Agent 任务上做到"够用",然后靠价格优势占领市场。

后续路线

马斯克同时预告了接下来的计划:

  • 下周:推出百万上下文版本
  • 月底:发布 2T 参数版本

按照 xAI 的节奏,2026 年每个月都会发布一个新模型,Grok 4.5 只是第一弹。

局限

  • 欧盟不可用,目前仍有区域限制
  • "Opus 级"需要打折扣,四场基准两胜两负,不是全面超越
  • Cursor 数据的偏差:模型编程能力偏向 Cursor 用户的使用模式,和常规开发者的实际工作流可能有差异
  • 成本优势有条件:高 reasoning effort 模式下 token 消耗可能快速上升,"便宜"是在特定使用模式下的结论

结论

Grok 4.5 是 xAI 至今最具竞争力的产品。它的差异化优势不在于"击败 Opus",而在于以显著更低的成本提供接近 Opus 级别的编程能力。

对 Cursor 用户来说,它是默认集成的,不需要额外配置。对 API 用户来说,$2/$6 的定价让它在编程和 Agent 任务上成为成本最优选之一。但如果你需要经过充分验证、有长期运行记录的通用模型,Opus 4.8 仍然是更稳妥的选择。

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板