SpaceXAI · Brief · 2026-07-12

Grok 4.5
前世今生

综合智力榜上它是第一梯队的第四名,不是 GPT-5.6 天花板。 Coding agent 在特定 harness 下能打到 GPT-5.5 附近,性价比叙事成立; 「≈ GLM 5.2」方向对,但低估了 Cursor 生态把它抬出的那一档。

公开日
2026-07-08
私人 beta ≈ 06-28
AA Intelligence
#4 · 54
落后 Fable 5 / GPT-5.5 / Opus 4.8
Coding Agent
76
与 GPT-5.5 Codex 持平
API 价格
$2 / $6
per 1M in / out tokens
不成立

「全面逼近 GPT-5.6 / 旗舰天花板」

成立(分场景)

Coding agent 接近 GPT-5.5;性价比出色

方向对、略低估

「≈ GLM 5.2」:GDPval 很近,coding 档更高

分层看

团队出走可核验;「训练崩了」属二级叙事

Timeline · 2023 → 2026

从 X 上的聊天机器人,到 SpaceXAI 的 coding 旗舰

Grok 的主战场在两年半里换了三次:先是「反鸡汤聊天」,再是冲榜与多模态,2026 年明确切到 coding / agent + 价格战,并和 Cursor 绑在一起。

关键转折

2026:xAI 并入 SpaceX,再牵手 Cursor

2026 年 2 月前后 SpaceX 收购 xAI,品牌走向 SpaceXAI。同年 6 月宣布约 $60B 全股票收购 Anysphere/Cursor(预计 Q3 交割)。7 月 8 日正式发布的 Grok 4.5,官方明确写了「trained alongside Cursor」:训练伙伴 + 分发渠道是同一条飞轮。

关系图

SpaceXAI

xAI 并入 SpaceX 后的 AI 品牌 / 实体。Grok 4.5 新闻稿署名已是 SpaceXAI。

证据层 B · Reuters / 官方

Cursor

训练伙伴 + 产品内置模型。收购案已宣布,交割前不等于完全 closing。

证据层 A/B · 官方 + Reuters

数据飞轮

真实 IDE 交互回流训练;二级来源称 supplemental 阶段用 Cursor 数据。飞轮真实,别当成永恒护城河。

证据层 A + 二级 caveat
Organization Risk · 2025–2026

创始团队大面积出走是硬事实

「训练遇到巨大困难、核心团队全部出走」这句口语里,前半句多属二级叙事,后半句在「大面积」意义上可核验,但「全部 / 80+ 工程师」要降权。

证据分层

出走可核验 · 「训练崩了」没有白皮书

CNBC、Observer 等一线媒体确认多位联合创始人离开。官方没有「训练失败」白皮书。可观测代理指标是:Musk 公开谈结构调整、产品线转向、以及与 Cursor 共训 / 收购。这证明执行路径在变,不等于证明上一轮训练「炸了」。

人名 时间 公开事实 来源层
Yuhuai (Tony) Wu 2026-02 前后 联合创始人离职;CNBC 称两天内第二位 A/B
Jimmy Ba 2026-02-10 在 X 发帖离开;对 Grok 4 相关研究有贡献(媒体表述) A/B
Igor Babuschkin 约 2025-07 前 DeepMind / OpenAI;离开后办 Babuschkin Ventures。精确日期各文不一 B
Christian Szegedy 2025-02 离开后去 Morph Labs,后创办 Math Inc. B
Greg Yang 2026-01 前后 因 Lyme 病减 / 退(媒体报道) B
Kyle Kosic 约 mid-2024 回 OpenAI(多源二级一致) C

一线媒体能支撑的

2025–2026 创始人与核心研究 / 工程层大幅流失。「大约一半创始团队离开」在 Observer / CNBC 语境下可支撑。Musk 公开说公司快速成长必须结构调整,「不得不与一些人分道扬镳」。

CNBC 2026-02-10 · Observer 2026-02

该降权的二级说法

「11 位联合创始人全部离开」「80+ 工程师出走」「performance dispute / 从根基重建」等多属二级或据报。Babuschkin 离职日各文写成 Jul / Aug 2025 甚至 2026-02,不要当单一真相。

The Next Web / Metaintro 等 · 降权

文化侧信号(单人访谈)

前音频员工 Vahid Kazemi 称 12 小时工作日含节假日,「所有 lab 在建同一件事很无聊」。这是文化体感,不能外推成训练失败证明,但能解释为什么出走叙事容易在社区扩散。

证据层 C · Observer / NBC 访谈引用
Benchmarks · Official vs Third-party

综合 #4 ≠ Coding 持平 GPT-5.5 ≠ 「全面 GPT-5.6 级」

三句话不要揉成一句。官方主打 coding / agent;Artificial Analysis 给综合第四;性价比与 token 效率是真正突出的卖点。

Artificial Analysis · 2026-07-08

Intelligence Index 54 · 排名第四

落后 Fable 5、GPT-5.5、Opus 4.8。相对 Grok 4.3 提升 16 分,把 SpaceXAI 推到前沿梯队,但仍明确不是综合第一。Coding Agent Index(Grok Build harness)得 76,与 GPT-5.5 (xhigh) in Codex 持平,略低于 Fable 5 in Claude Code。

指标 Grok 4.5 相对位置
Intelligence Index 54 #4 · 落后 Fable 5 / GPT-5.5 / Opus 4.8
Coding Agent Index 76 与 GPT-5.5 Codex 持平 · 低于 Fable 5 Claude Code
GDPval-AA v2 Elo 1543 Opus 4.8 = 1600 · GLM-5.2 = 1513(夹在中间)
成本(Intelligence / Coding) ~$0.31 / ~$2.59 per task AA 称处 Pareto 前沿
Context 500k 低于 Grok 4.3 的 1M
API 标价 $2 / $6 per 1M 相对 Opus $5/$25、部分 GPT-5.5 档更便宜

官方宣传(采信产品事实)

定位:coding、agentic、knowledge work。训练:数万 NVIDIA GB300;大规模 RL,「hundreds of thousands of tasks」。速度:80 TPS,约 2× token 效率。渠道:Grok Build、Cursor、API。欧盟暂不可用(发布时口径)。

x.ai/news/grok-4-5 · 证据层 A

参数口径冲突

官方新闻稿不写精确参数量。Musk 口头「约 1.5T、约为前代 3×」由 AA 等转述。YouTube 等「6T」类内容与主流口径冲突,按噪音处理。Context 500k vs 口头可能回到 1M:规格与承诺冲突,以当前规格为准。

Musk 披露经转述 · 非官方正文

是否「接近 GPT-5.x」:分场景答

1. Coding agent(特定 harness):与 GPT-5.5 Codex 同档 → 接近成立。
2. 综合 Intelligence Index:明确落后 GPT-5.5,更落后 Fable 5 → 「全面逼近 / 超越旗舰」不成立。
3. 性价比 / token 效率:多方一致偏强 → 叙事成立。
4. LMSYS Arena:本轮未拿到 Grok 4.5 稳定 Elo;4.1/4.20 时代高位不能外推。

Community · Split Narratives

同一款模型,三套完全不同的话术

Musk 说 Opus-class;榜单说综合第四;中文训练营体感说「像 GLM 5.2」。三套话各自击中不同切片,硬揉成一句就会失真。

Musk / X

「Opus-class… faster, more token-efficient and lower cost」。应读作营销对标 + 成本叙事,不是综合榜第一的声明。

证据层 A 经媒体 · Reuters / Axios

中文圈

正向:编码进第一梯队、Cursor 共训关键、价高于 GLM 但生态更顺。也有声音把它放在「接近 GLM 5.2」的体感档:中文偶掉链、context 仅 50 万。

证据层 C · 知乎 / X / Threads

英文圈

主叙事是 coding + agent + 便宜,不是「全面最聪明」。撕裂点:官方 Opus-class vs AA #4;有人吹 Terminal Bench,有人指出 DeepSWE / SWE 分项仍掉队。

证据层 C · 博客 / 评测文
对你训练营里那句「≈ GLM 5.2」

方向合理,但漏掉了 Cursor 这一档

GDPval Elo:Grok 1543 vs GLM-5.2 1513,确实很近。如果只谈「综合知识工作体感、中文、开源可控」,把 Grok 看成 GLM 同档是清醒的防神话锚点。如果谈 coding agent + Cursor 内置分发,Grok 会被抬出「纯性价比开源档」。两套尺子量出两个答案,不要用一把尺子否定另一把。

声音 主张 该怎么读
评测平台头条 把 Grok 4.5 放进「接近 GPT-5.x」叙事 核对是综合榜还是 coding harness;很多标题在偷换场景
性价比派 打骨折价硬刚 Opus / GPT 与 AA Pareto 前沿一致,这是当前最强卖点
开源 / 中文派 仍看 GLM-5.2 等 中文、开源、价格可控时合理;别假装 Grok 取代这条线
Cursor 用户 产品集成是真的飞轮 欢迎效率,也要担心编辑器被模型厂控股后的锁定
Editorial · How to Decide

跨代大跃进不可信;别神话,也别直接打折到「平庸」

选型不靠信仰。先选尺子,再读分数。下面是给「要不要认真用 Grok 4.5」的决策框架。

一句话结论

第一梯队够用,且便宜 · 不是天花板

如果你要的是 coding agent 性价比、且人在 Cursor / Grok Build 生态里:认真看。如果你要的是综合智力天花板、中文深度、或开源可控:别被「Opus-class」标题带跑,GLM 5.2 量级的直觉在综合体感上仍有价值。

该信哪一层证据

A 官方:产品定位、价格、渠道、是否与 Cursor 共训。
B 第三方榜:AA 综合第四、coding 持平 GPT-5.5 Codex。
C 社区体感:方向信号强,单条不可当事实;「≈ GLM」是防神话锚点,不是精确标定。

组织风险怎么折进选型

创始团队大面积出走是硬事实,与「模型突然变强」可以并存。执行依赖 Musk 集权 + 新招人(含 Cursor 侧)。产品能力可以今天就用;长期稳定性不要默认等于 OpenAI / Anthropic 那种研究梯队连续性。

适合认真用

Agentic coding、IDE 内长任务、对 $/token 敏感、愿意接受「第一梯队够用」而不是「绝对最强」的团队。

不适合神话

需要综合旗舰天花板、强中文写作 / 推理一致性、开源可私有部署、或把「Musk 说 Opus-class」当成评测结论的场景。

和你直觉的对齐

不信跨代大跃进:对。觉得「≈ GLM 5.2」更合理:在综合体感上方向对,在 coding agent + Cursor 分发上略低估。正确读法是「别神话」,不是「可以无视」。

主要来源