OpenAI 发布 GPT-5.6 Sol、Terra、Luna:Sol 是下一代 frontier model,Terra 面向日常高效工作,Luna 主打高吞吐低成本。
X 日报个人阅读
2026 年 6 月 27 日 · 周六
2026-06-26 08:00 至 2026-06-27 08:00(北京时间)
关注账号覆盖
条入选
个主题
晨间播报
开车或走路时直接听;会记住播放速度和上次听到的位置。下载 MP3
编辑导言
这一期的主旋律不是单纯又一个新模型发布,而是模型能力、发布权限和产业叙事同时拧在一起。OpenAI 的 GPT-5.6 家族把能力分层、成本分层和受限预览一起推出,Sam Altman 又把美国政府介入、迭代部署和未来普遍可用放在同一个解释框架里。模型发布正在从产品事件变成治理事件,谁能用、何时能用、以什么名义先用,开始和 benchmark 一样重要。
另一条线更适合慢读:AI 的真实使用正在被量化。Anthropic 从 Claude 的小时级使用节奏、artifacts 和用户调查切入,Microsoft 用 500 万条 M365 Copilot 会话回答办公场景里到底发生了什么。相比“AI 会替代谁”的宏大争论,这些数据更接近下一阶段产品和组织变革的地基。
同时,Gemini 的更新把 AI 继续推向日常入口和小商业场景,Chollet 与 Stanford AI Lab 则提醒另一端的问题:真正的 autonomy 不是无人监督地行动,而是能不能摆脱人类数据与实验瓶颈继续学习。今天的信号合在一起看,AI 竞争正从“谁的模型更强”扩展为“谁拥有发布通道、使用证据、产品入口和自我改进机制”。
01GPT-5.6 与受限发布
OpenAI 把新一代模型能力、成本分层和政府介入放在同一天公开,模型发布同时变成了治理事件。
OpenAI 称会在未来数周推动 GPT-5.6 家族普遍可用,但当前应美国政府要求,先在 Codex 和 API 中向少量 trusted partners 做 limited preview。
OpenAI 解释三档模型定位:Sol 相比 GPT-5.5 有阶跃提升,Terra 以半价达到接近 GPT-5.5 的表现,Luna 是最低成本强能力模型。
OpenAI 表示 GPT-5.6 Sol 在 Terminal-Bench 2.1 上达到新 SOTA,这个测试关注复杂命令行工作流里的规划、迭代和工具协调。
OpenAI 称 GPT-5.6 Sol 是其目前最强 cybersecurity 模型,改善长周期安全任务中的性能效率边界,包括漏洞研究和利用。
Greg Brockman 转发 GPT-5.6 Sol preview,给出简短判断:这是一个好模型。
Sam Altman 补充说明:Sol 价格与 GPT-5.5 相同,Terra 半价;受限预览并非 OpenAI 原计划,但他认为高能力模型采用迭代部署可以理解。
Sam Altman 透露 GPT-5.6 Sol 在 7 月将达到 750 token/sec,强调下一步不只是能力,也包括吞吐体验。
Bindu Reddy 迅速解读 GPT-5.6 Sol 的成本位置,认为这是 OpenAI 最强模型,并把它与 Fable level intelligence 的价格进行对照。
02开放模型与中美叙事
围绕美国限制、闭源节奏和中国开源领先的讨论升温,模型能力正在被放进地缘政治框架里解读。
Emad Mostaque 追问:美国是否会让高于 Fable 水平的开源模型变成非法,直接把开源模型能力和监管边界放在一起讨论。
Bindu Reddy 认为如果 closed AI pause 持续,frontier model 公司可能退化成营销昂贵的 Slack bot,而中国会在 real AI 上领先。
Bindu Reddy 用强烈对比表达担忧:美国这个民主国家在“禁止 AI”,而中国这个威权体制却成为 open-source AI 领导者。
Yann LeCun 转推开放模型压力将上升的观点,核心意思是 open 不只是两家大公司的选择,而会受到更多资金和游说推动。
03AI 工作影响被量化
Anthropic 和 Microsoft 同日把 AI 使用从叙事拉回数据,开始回答人们到底在什么时间、什么场景、用 AI 产出什么。
Anthropic 更新 Claude Econ Index,用小时级采样和调查数据研究 Claude 的经济影响、生活节奏中的使用方式,以及人们对 AI 影响的感知变化。
Anthropic 展示 Claude 使用的日内节奏:早晨新闻请求上升,晚间菜谱请求达到高峰,睡眠建议常在清晨 5 点出现。
Claude Econ Index 新增 artifacts 追踪,比较 Claude 会话中主要产物在工作、课程和个人生活中的使用差异。
Anthropic 调查显示,超过三分之一用户预计 AI 一年内能完成大部分或几乎全部工作任务,但高委托用户反而更乐观看待收入和工作安全。
Anthropic 还发现,近半受访者预计未来 12 个月工作职责会显著改变;担心自己失业的人少于 10%,但更多人担心初级同事。
Microsoft Research 指向一项对 500 万条 M365 Copilot 会话的分析,试图回答人们在工作中实际拿 AI 做什么。
04Gemini 产品线加速落地
Google 的信号集中在消费端和小商业场景:实时图像、Business notebooks、应用推荐和 AI Studio 变体探索。
Google Gemini 发布本月 Gemini Drops,总览从语音实时生成图像到小企业支持的一组更新。
Gemini Live 加入直接创建和编辑图像能力:用户可打开手机 Gemini app,共享摄像头后用语音描述想看到的画面。
Gemini 推出 Business notebooks,可安全连接 Google Business Profile,集中管理小企业资料、历史对话和行动建议。
Gemini 的 Thinking Levels 已覆盖 Web、iOS 和 Android,说明推理档位正在成为面向普通用户的显式产品控制项。
Logan Kilpatrick 展示 Google AI Studio 的 design variations:做出一个 app 后,可以探索不同变体,把想法推向新的方向。
Bindu Reddy 展示 multi-LLM agents 用一个 prompt 构建 Slack-like app,组合 Opus、GPT 5.5 和 open-source LLMs 来平衡成本与性能。
05智能、benchmark 与自治循环
Chollet 和 Stanford AI Lab 的几条帖子把焦点从模型榜单拉到“能否学习”和“能否自我完成科学循环”。
François Chollet 重新定义 autonomy:不是没有人类监督地行动,而是在学习过程中不依赖人类瓶颈;依赖人类训练数据和 RL 环境的系统只是人类知识的印痕。
Chollet 批评静态数据集 benchmark:如果采样来自训练时已高度可知的静态分布,本质上是在测记忆和检索,不应误称为智能。
Stanford AI Lab 介绍 Auto-psych:AI agents 自己提出理论、设计实验、在线招募真人并根据结果改进,试图覆盖完整科学循环。
06模型研究与开源进展
底层研究线索不多但质量明确:位置编码、世界模型表征和开源 text-to-image 都指向更长上下文与更开放的模型生态。
Yuandong Tian 介绍 TAPA:在 position encoding 中解耦 magnitude 与 angular contributions,相比 vanilla RoPE 提升长上下文 OOD 表现,并给出理论分析。
Yann LeCun 转推 MJEPA 论文被 ECCV2026 接收的消息,延续 JEPA 路线在表征学习和视觉理解上的研究推进。
Yann LeCun 转推 PRX Pixel:一个开源 7B text-to-image 模型,直接在像素空间生成图像。
07工程现场的硬边界
几条开发者信号提醒人们:Agent 能写应用,但真实系统里的 crash state、notarization 和平台协议仍是绕不过去的工程边界。
Peter Steinberger 反驳轻视 crash reporting 的观点:处于 crash state 或收到 signal 时,很多情况下连内存分配都不能做。
Steinberger 吐槽 Apple notarization 一年多次被新的 legal agreements 打断,需要人工登录接受协议才恢复。
低信号与抓取缺口
窗口内零发帖账号(status=ok 且 window_post_count=0,是真的窗口内无更新):Red_Xiao_、ManusAI、hugo_larochelle、drfeifei、srush_nlp、soumithchintala、goodfellow_ian、ShunyuYao12、NotebookLM、berkeley_ai、KrugerSays、AIatMeta、ilyasut、sundarpichai、ThomasOrTK、karpathy、demishassabis、timnitGebru、lexfridman、JeffDean、elicollins、BaiduResearch、Metamind、IntelAI、Tesla_AI、IBMResearch、GoogleDeepMind、GoogleAI、rowancheung、ID_AA_Carmack、Yoshua_Bengio、AndrewYNg。 有发帖但未选入主报告账号(发了但未入选,不能视为无更新):ZackKorman、wadefoster、OriolVinyalsML。ZackKorman 是语境依赖较强的回复,wadefoster 是单条低上下文短帖,OriolVinyalsML 是单条内部往事讨论,均不适合进入主报告;此外 sama、steipete、fchollet、ylecun 等账号的部分短帖、偏题帖或纯 RT 已降权处理,只有与主线高度相关的内容被选入。 抓取失败账号(status!=ok):seb_ruder、kaifulee、geoffreyhinton。 本次窗口不是低信号日,raw 内共有 51 条窗口内帖子,主报告优先收录原创发布、官方产品更新、研究进展和少量具备传播价值的强信号转推;回复、纯短句、低上下文梗和偏离 AI 主线的内容被降权处理。