OpenAI 新语音模型是真的,名字是 GPT-Live。
OpenAI 在 2026-07-08 发布 GPT-Live-1 与 GPT-Live-1 mini,ChatGPT Voice 先行,API 标注为 soon。另有 Realtime API 2.1 系列面向开发者低延迟语音体验。
结论先放前面:GPT-Live 已经是一次明确的语音架构升级,核心不是音色变好,而是 full-duplex 连续对话、打断处理和前沿模型委托;GPT-5.6 也已经有正式 system card,并在美国时间 2026-07-09 宣布向 ChatGPT、Codex 与 API 逐步 GA。
以下按官方页面、system card、帮助中心与 Anthropic 官方说明交叉核验。结论里的日期统一写成绝对日期,避免“今天/很快”在跨时区里失真。
OpenAI 在 2026-07-08 发布 GPT-Live-1 与 GPT-Live-1 mini,ChatGPT Voice 先行,API 标注为 soon。另有 Realtime API 2.1 系列面向开发者低延迟语音体验。
2026-06-26 是 preview;2026-07-09 官方宣布 Sol、Terra、Luna general availability,并说明 ChatGPT、Codex 与 API 24 小时逐步推出。
Anthropic 2026-06-30 说明美国政府在 6 月 12 日施加限制,后续解除;2026-07-01 更新称 Fable 5 重新全球可用,Mythos 5 仍是受限可信访问。
这一版的关键提升不是单点参数,而是交互架构改变。OpenAI 自己把它放在三代语音系统的演进里解释:级联系统、Advanced Voice Mode、GPT-Live。
语音先转文本,文本再进语言模型,最后再转语音。中间步骤会丢掉语调、停顿、情绪等音频线索,也天然增加延迟。
AVM 能直接处理音频输入输出,但需要等待用户停顿来判断一轮结束,因此容易把短暂停顿误判成结束,或把自然打断处理得生硬。
full-duplex 架构让模型持续处理输入和输出。它可以边听边给“嗯”“对”这类短反馈,也能在用户思考时保持安静。
需要 web search、复杂推理或更深工作时,GPT-Live 会把任务交给当前前沿模型。发布时后台写明使用 GPT-5.5,未来会随前沿模型更新。
官方说明强调更自然的 turn-taking、interruption behavior、silence/noise handling。Developer Community 对 Realtime 2.1 也提到 p95 延迟至少下降 25%。
GPT-Live 自身负责连续口语体验;复杂任务通过委托机制接入 frontier reasoning,因此“语音模型”不再只是语音外壳。
GPT-Live system card 展示了 voice-native safety eval。GPT-Live-1 在 synthetic prompt 的 illicit、self-harm、mental health 等安全遵循分数上明显高于 AVM。
OpenAI 明确说 launch 时不支持 voice with video 或 screen sharing。API 是 soon,不是已完全开放。
OpenAI 先在 2026-06-26 做 GPT-5.6 Sol limited preview,随后在 2026-07-09 发布 GPT-5.6 GA 与 updated system card。模型家族包括 Sol、Terra、Luna。
官方 GA 页把 GPT-5.6 描述为“scales with your ambition”的前沿模型家族。它重点强调 agentic coding、knowledge work、cybersecurity、scientific discovery,以及 Responses API 的 Programmatic Tool Calling 和 Multi-agent beta。
System card 写明 GPT-5.6 在 Cybersecurity 与 Biological/Chemical 方向达到 High capability,AI Self-Improvement 未达到 High。OpenAI 说 Sol 的网络安全防护会阻断约 10 倍更多潜在有害活动,并用超过 700,000 A100e GPU hours 做自动化红队。
GPT-5.6 Sol preview 面向 API 与 Codex 的有限测试。帮助中心当时写明 ChatGPT 尚不可用,也没有 GA 日期。
OpenAI 宣布 GPT-5.6 family general availability,ChatGPT、Codex 与 API 从当天起逐步推出,灰度窗口约 24 小时。
如果账号不在首批或还没看到 Codex 线上 GPT-5.6,这和官方“24 小时逐步 rollout”并不冲突,也可能受 Free/Go/Plus/Pro/Enterprise 档位影响。
下面这张表主要来自 OpenAI GPT-5.6 GA 页公开图表。它适合判断 OpenAI 想讲什么,但不能替代独立第三方统一复测。
| Benchmark / 口径 | OpenAI GPT-5.6 | Anthropic Fable / Mythos | 读法 |
|---|---|---|---|
| Agents' Last Exam | Sol 52.7,官方称 medium effort 以约四分之一成本超过 Fable。 | Fable 40.5。 | OpenAI 自报里,GPT-5.6 在通用 agent 任务上明显领先。 |
| Artificial Analysis Intelligence Index | Sol max 58.9。 | Fable 59.9。 | Fable 分数略高;OpenAI 强调 Sol 用时少 61%、成本约一半。 |
| Coding Agent Index | Sol 80.0,Terra 77.4,Luna 74.6。 | Fable 77.2。 | OpenAI 自报 Sol 略胜,Terra 也略高于 Fable。 |
| SWE-Bench Pro | Sol 64.6,Terra 63.4,Luna 62.7。 | Mythos 80.3,Fable 80.0。 | 软件工程真实修复类口径里,Anthropic 显著领先。 |
| Terminal-Bench 2.1 | Sol Ultra 91.9,Sol 88.8。 | Mythos 88.0,Fable 83.1。 | 终端操作类任务 OpenAI 领先,尤其 ultra effort。 |
| Toolathlon | Sol 58.0,Terra 53.1,Luna 53.4。 | Fable / Mythos 61.7。 | 工具调用竞赛口径 Anthropic 领先。 |
| FrontierMath Tier 4 | Sol 65.9,Terra 68.3,Luna 58.5。 | Fable 87.8。 | 高难数学口径 Fable 明显领先。 |
| Pricing | Sol $5 / $30,Terra $2.50 / $15,Luna $1 / $6,每百万输入/输出 tokens。 | Fable 与 Mythos $10 / $50,每百万输入/输出 tokens。 | 按官方标价,OpenAI 这一代明显打成本效率。 |
注:Fable 的官方 system card 页面在本次抓取时返回 502,但 Anthropic 发布页和 redeploy 说明足够确认其发布、限制、恢复与防护机制。benchmark 分数来自 OpenAI GA 页,需视为模型厂商自评口径。
Fable 5 和 Mythos 5 是同一底层模型的不同安全访问形态。Fable 面向一般可用,Mythos 面向 Project Glasswing 与获批组织。
Anthropic 发布 Claude Fable 5 与 Mythos 5。Fable 是为一般使用加固后的 Mythos-class model。
Anthropic 称美国政府要求限制外国国民访问 Fable 5 与 Mythos 5,因此它们曾暂停对所有用户开放。
限制解除后,Fable 5 在 Claude Platform、Claude.ai、Claude Code、Claude Cowork 等恢复;Mythos 5 只恢复给部分美国组织。
Anthropic 称涉及 cyber、bio/chem、distillation 等检测时,Fable 会 fallback 到 Opus 4.8。平均少于 5% sessions 触发 fallback。
优先使用官方发布页、system card、帮助中心与开发者社区。模型能力分数以厂商自报为边界,不把营销图表写成独立事实。