从 X 上的聊天机器人,到 SpaceXAI 的 coding 旗舰
Grok 的主战场在两年半里换了三次:先是「反鸡汤聊天」,再是冲榜与多模态,2026 年明确切到 coding / agent + 价格战,并和 Cursor 绑在一起。
2026:xAI 并入 SpaceX,再牵手 Cursor
2026 年 2 月前后 SpaceX 收购 xAI,品牌走向 SpaceXAI。同年 6 月宣布约 $60B 全股票收购 Anysphere/Cursor(预计 Q3 交割)。7 月 8 日正式发布的 Grok 4.5,官方明确写了「trained alongside Cursor」:训练伙伴 + 分发渠道是同一条飞轮。
-
2023-03 / 07
xAI 创立并公开亮相
Elon Musk 创办 xAI,定位与 OpenAI / Google 竞争的「寻求宇宙真相」叙事。
-
2023-11-03
Grok / Grok-1 上线
先挂在 X Premium:有态度的聊天机器人,不是今天的 coding agent 人设。
-
2024-03
Grok-1 开源 · 314B MoE
Apache-2.0 放出权重,随后有 Grok-1.5(128k context)与 Vision 版本。
-
2024-08 → 2025-07
Grok 2 → Grok 3 → Grok 4
产品线加速迭代:冲榜、多模态、Heavy 变体。2025 年 3 月前后 xAI 以全股票交易收购 X(估值说法不一)。
-
2025-11 → 2026-04
4.1 / 4.3:幻觉下降与长上下文叙事
4.1 / Fast 主打幻觉下降;4.3 Beta 等二级来源出现。Context 一度到 1M 量级。
-
2026-02
SpaceX 收购 xAI → SpaceXAI
组织与品牌并入 SpaceX 体系。同一时期联合创始人密集离职(见 Tab 02)。
-
2026-06
宣布收购 Cursor · Grok 4.5 私人 beta
约 $60B 收购案与私人 beta(约 06-28,Musk / 二级转述)几乎同期。不要把私人 beta 日和公开发布日混用。
-
2026-07-08
Grok 4.5 正式发布
官方新闻稿:coding、agentic、knowledge work;渠道含 Grok Build、Cursor(all plans)、API
grok-4.5。
SpaceXAI
xAI 并入 SpaceX 后的 AI 品牌 / 实体。Grok 4.5 新闻稿署名已是 SpaceXAI。
Cursor
训练伙伴 + 产品内置模型。收购案已宣布,交割前不等于完全 closing。
数据飞轮
真实 IDE 交互回流训练;二级来源称 supplemental 阶段用 Cursor 数据。飞轮真实,别当成永恒护城河。
创始团队大面积出走是硬事实
「训练遇到巨大困难、核心团队全部出走」这句口语里,前半句多属二级叙事,后半句在「大面积」意义上可核验,但「全部 / 80+ 工程师」要降权。
出走可核验 · 「训练崩了」没有白皮书
CNBC、Observer 等一线媒体确认多位联合创始人离开。官方没有「训练失败」白皮书。可观测代理指标是:Musk 公开谈结构调整、产品线转向、以及与 Cursor 共训 / 收购。这证明执行路径在变,不等于证明上一轮训练「炸了」。
| 人名 | 时间 | 公开事实 | 来源层 |
|---|---|---|---|
| Yuhuai (Tony) Wu | 2026-02 前后 | 联合创始人离职;CNBC 称两天内第二位 | A/B |
| Jimmy Ba | 2026-02-10 | 在 X 发帖离开;对 Grok 4 相关研究有贡献(媒体表述) | A/B |
| Igor Babuschkin | 约 2025-07 | 前 DeepMind / OpenAI;离开后办 Babuschkin Ventures。精确日期各文不一 | B |
| Christian Szegedy | 2025-02 | 离开后去 Morph Labs,后创办 Math Inc. | B |
| Greg Yang | 2026-01 前后 | 因 Lyme 病减 / 退(媒体报道) | B |
| Kyle Kosic | 约 mid-2024 | 回 OpenAI(多源二级一致) | C |
一线媒体能支撑的
2025–2026 创始人与核心研究 / 工程层大幅流失。「大约一半创始团队离开」在 Observer / CNBC 语境下可支撑。Musk 公开说公司快速成长必须结构调整,「不得不与一些人分道扬镳」。
该降权的二级说法
「11 位联合创始人全部离开」「80+ 工程师出走」「performance dispute / 从根基重建」等多属二级或据报。Babuschkin 离职日各文写成 Jul / Aug 2025 甚至 2026-02,不要当单一真相。
文化侧信号(单人访谈)
前音频员工 Vahid Kazemi 称 12 小时工作日含节假日,「所有 lab 在建同一件事很无聊」。这是文化体感,不能外推成训练失败证明,但能解释为什么出走叙事容易在社区扩散。
综合 #4 ≠ Coding 持平 GPT-5.5 ≠ 「全面 GPT-5.6 级」
三句话不要揉成一句。官方主打 coding / agent;Artificial Analysis 给综合第四;性价比与 token 效率是真正突出的卖点。
Intelligence Index 54 · 排名第四
落后 Fable 5、GPT-5.5、Opus 4.8。相对 Grok 4.3 提升 16 分,把 SpaceXAI 推到前沿梯队,但仍明确不是综合第一。Coding Agent Index(Grok Build harness)得 76,与 GPT-5.5 (xhigh) in Codex 持平,略低于 Fable 5 in Claude Code。
| 指标 | Grok 4.5 | 相对位置 |
|---|---|---|
| Intelligence Index | 54 | #4 · 落后 Fable 5 / GPT-5.5 / Opus 4.8 |
| Coding Agent Index | 76 | 与 GPT-5.5 Codex 持平 · 低于 Fable 5 Claude Code |
| GDPval-AA v2 Elo | 1543 | Opus 4.8 = 1600 · GLM-5.2 = 1513(夹在中间) |
| 成本(Intelligence / Coding) | ~$0.31 / ~$2.59 per task | AA 称处 Pareto 前沿 |
| Context | 500k | 低于 Grok 4.3 的 1M |
| API 标价 | $2 / $6 per 1M | 相对 Opus $5/$25、部分 GPT-5.5 档更便宜 |
官方宣传(采信产品事实)
定位:coding、agentic、knowledge work。训练:数万 NVIDIA GB300;大规模 RL,「hundreds of thousands of tasks」。速度:80 TPS,约 2× token 效率。渠道:Grok Build、Cursor、API。欧盟暂不可用(发布时口径)。
参数口径冲突
官方新闻稿不写精确参数量。Musk 口头「约 1.5T、约为前代 3×」由 AA 等转述。YouTube 等「6T」类内容与主流口径冲突,按噪音处理。Context 500k vs 口头可能回到 1M:规格与承诺冲突,以当前规格为准。
是否「接近 GPT-5.x」:分场景答
1. Coding agent(特定 harness):与 GPT-5.5 Codex 同档 → 接近成立。
2. 综合 Intelligence Index:明确落后 GPT-5.5,更落后 Fable 5 → 「全面逼近 / 超越旗舰」不成立。
3. 性价比 / token 效率:多方一致偏强 → 叙事成立。
4. LMSYS Arena:本轮未拿到 Grok 4.5 稳定 Elo;4.1/4.20 时代高位不能外推。
同一款模型,三套完全不同的话术
Musk 说 Opus-class;榜单说综合第四;中文训练营体感说「像 GLM 5.2」。三套话各自击中不同切片,硬揉成一句就会失真。
Musk / X
「Opus-class… faster, more token-efficient and lower cost」。应读作营销对标 + 成本叙事,不是综合榜第一的声明。
中文圈
正向:编码进第一梯队、Cursor 共训关键、价高于 GLM 但生态更顺。也有声音把它放在「接近 GLM 5.2」的体感档:中文偶掉链、context 仅 50 万。
英文圈
主叙事是 coding + agent + 便宜,不是「全面最聪明」。撕裂点:官方 Opus-class vs AA #4;有人吹 Terminal Bench,有人指出 DeepSWE / SWE 分项仍掉队。
方向合理,但漏掉了 Cursor 这一档
GDPval Elo:Grok 1543 vs GLM-5.2 1513,确实很近。如果只谈「综合知识工作体感、中文、开源可控」,把 Grok 看成 GLM 同档是清醒的防神话锚点。如果谈 coding agent + Cursor 内置分发,Grok 会被抬出「纯性价比开源档」。两套尺子量出两个答案,不要用一把尺子否定另一把。
| 声音 | 主张 | 该怎么读 |
|---|---|---|
| 评测平台头条 | 把 Grok 4.5 放进「接近 GPT-5.x」叙事 | 核对是综合榜还是 coding harness;很多标题在偷换场景 |
| 性价比派 | 打骨折价硬刚 Opus / GPT | 与 AA Pareto 前沿一致,这是当前最强卖点 |
| 开源 / 中文派 | 仍看 GLM-5.2 等 | 中文、开源、价格可控时合理;别假装 Grok 取代这条线 |
| Cursor 用户 | 产品集成是真的飞轮 | 欢迎效率,也要担心编辑器被模型厂控股后的锁定 |
跨代大跃进不可信;别神话,也别直接打折到「平庸」
选型不靠信仰。先选尺子,再读分数。下面是给「要不要认真用 Grok 4.5」的决策框架。
第一梯队够用,且便宜 · 不是天花板
如果你要的是 coding agent 性价比、且人在 Cursor / Grok Build 生态里:认真看。如果你要的是综合智力天花板、中文深度、或开源可控:别被「Opus-class」标题带跑,GLM 5.2 量级的直觉在综合体感上仍有价值。
该信哪一层证据
A 官方:产品定位、价格、渠道、是否与 Cursor 共训。
B 第三方榜:AA 综合第四、coding 持平 GPT-5.5 Codex。
C 社区体感:方向信号强,单条不可当事实;「≈ GLM」是防神话锚点,不是精确标定。
组织风险怎么折进选型
创始团队大面积出走是硬事实,与「模型突然变强」可以并存。执行依赖 Musk 集权 + 新招人(含 Cursor 侧)。产品能力可以今天就用;长期稳定性不要默认等于 OpenAI / Anthropic 那种研究梯队连续性。
适合认真用
Agentic coding、IDE 内长任务、对 $/token 敏感、愿意接受「第一梯队够用」而不是「绝对最强」的团队。
不适合神话
需要综合旗舰天花板、强中文写作 / 推理一致性、开源可私有部署、或把「Musk 说 Opus-class」当成评测结论的场景。
和你直觉的对齐
不信跨代大跃进:对。觉得「≈ GLM 5.2」更合理:在综合体感上方向对,在 coding agent + Cursor 分发上略低估。正确读法是「别神话」,不是「可以无视」。