这一期的主旋律很清楚:AI 产品正在从模型发布会,进入工作系统发布会。OpenAI 用 GPT-5.6、ChatGPT Work、桌面应用和 hosted sites 把模型能力包装成一套跨端工作入口;Meta 的 Muse Spark 1.1 也把多模态、computer use、多 agent 编排和代码工作流放在同一个叙事里。今天真正值得看的不是某个 benchmark 又涨了几分,而是这些能力开始被定义成“可以接住整段工作”的产品形态。
第二条线是开发者工作流的再组织。Manus 的 Branch、Claude Code 的 /checkup、Claude Tag 的多人协作、builder 圈对 Codex 单人化副作用的讨论,都指向同一个问题:AI 不是只替人写代码,而是在重写任务如何分叉、检查、协作和交付。模型越强,组织里越需要重新设计“人和人如何继续共同工作”。
第三条线更冷,但更长期:开源、AI 主权、治理结构、隐藏偏见检测、verification scaling 和 agent 自我训练都在同一天冒头。热闹的发布会背后,真正的基础设施问题仍然是:谁控制模型,模型如何被审计,agent 如何知道自己缺什么,以及成果如何从漂亮 demo 走进可验证的工作闭环。
OpenAI 把新模型、Codex、桌面端和跨应用 agent 放进同一次发布,重点从问答能力转向完成工作。
OpenAI 宣布 Sol、Terra、Luna 组成的 GPT-5.6 模型族开始在 ChatGPT、Codex 和 API 中推出。
GPT-5.6 Sol 在 Agents' Last Exam 上达到 53.6,OpenAI 强调它以更低成本超过 Claude Fable 5,Terra 和 Luna 也主打成本效率。
Sam Altman 在直播中点出本次发布的三个产品重点:ChatGPT Work、新桌面应用和 hosted sites。
Greg Brockman 将 GPT-5.6 概括为 Sol 加 Terra/Luna:面向 coding、知识工作、网络安全和科学任务,以更少 token 和更低成本完成工作。
OpenAI 发布 ChatGPT Work,称它由 Codex 和 GPT-5.6 驱动,可以跨应用和文件执行动作,并长时间跟进项目直到形成成品。
ChatGPT Work 的 rollout 口径也很清楚:Web 和移动端先给 Pro、Enterprise、Edu,Plus 和 Business 随后;桌面端把 Chat、Work、Codex 合到同一个应用里。
多条信号显示,agent 产品竞争正在从模型调用转向上下文继承、分支、检查、多人协作和组织协同。
Manus 发布 Branch:可以把一段对话分叉成继承完整上下文的并行 session,让同一研究过程同时走向报告、幻灯片或投资人 brief。
OpenAI 对 ChatGPT Work 的定位是从回答问题转向跨 web、mobile、desktop 完成完整 workflow,并在用户控制下产出文档、deck、分析、网站和报告。
Greg Brockman 强调 ChatGPT Work 把 ChatGPT 和 Codex 合在一起,移动端、Web 和桌面端都能使用,不再要求电脑一直开着。
Claude Code 增加 /checkup,用来清理未用 skills、MCP、plugins,拆分 CLAUDE.md,关闭慢 hooks,升级版本并预批准常见只读命令。
Cat Wu 预告 Claude Tag walkthrough,描述从单人 Claude Code 走到多人 Claude Tag:agent 可以监控 channel、主动工作、被团队共同 steering,并记住上周交代过的事。
Zara 观察到一个团队给所有人买 Codex Max 后,个人效率上去了,但人和人之间的协作变少,提出下一阶段应是 human-human-agent collaboration。
OpenAI、Meta 和 Google 都在把实时语音、视觉输入、跨应用操作和多步上下文维持打包成下一代交互入口。
GPT-Live 已向 ChatGPT Go、Plus、Pro 用户完全推出,免费用户 rollout 也在进行中,OpenAI 要求用户更新 iOS 或 Android 应用体验。
OpenAI 正在寻找 GPT-Live API 的 design partner,鼓励开发者做新的创意应用或接入已有产品。
Meta 发布 Muse Spark 1.1,同时开放新的 Meta Model API public preview,模型也进入 Meta AI app 和网页端的 Thinking mode。
Muse Spark 1.1 被描述为面向 agentic tasks 的多模态推理模型,重点提升 tool use、computer use、coding 和多模态理解。
Meta 展示 Muse Spark 1.1 在多应用 computer-use workflow 中保持长会话上下文,并在脚本、直接 UI 操作和批处理动作之间选择策略。
Gemini Live 增加 Nano Banana 和 connected apps 支持,用户可以用摄像头展示内容,边说边规划和可视化项目,也能联动 Google Maps。
围绕 GPT-5.6、Fable、Grok、Opus 的讨论不只是排名,而是把不同模型放到不同任务、价格和产品入口里动态调度。
Bindu Reddy 给出模型体感排序:Fable 5 仍适合高难任务,GPT 5.6 接近 Opus 4.8 但更快更便宜,Grok 4.5 超过 GLM 5.2 但仍落后于 4.8。
她提出用 Fable 5 做 advisor,其他 LLM 做 workers:GPT 5.6 sol 管后端编码,Opus 4.8 管前端和功能,Grok 4.5 管简单 coding。
LiveBench AI 上 GPT 5.6 Sol 被她称为 benchmark leader,同时她仍认为 Fable 更适合复杂多轮 agentic loops。
Abacus AI 推出 Max Mode,自动路由到 Fable 5 或 GPT 5.6 Sol,并把复杂 SaaS、custom workflows、移动应用和常驻交易服务器作为目标场景。
Aaron Levie 认为最新模型越来越擅长复杂知识工作,尤其是法律、专业服务、医疗等垂直领域,Grok 4.5 在 cost 和 performance 上是重要新入口。
Vercel 宣布 Grok 4.5 对所有 Vercel 客户可用,说明模型能力正被快速接入开发平台和部署平台。
在发布会热度之外,关注列表里仍有强烈的治理线索:AI 主权、开源保护、公益信托、IPO 批评和项目独立性。
Yann LeCun 认为 AI 最大风险是少数专有 AI assistant 提供商的权力集中,AI 主权的解法只能是开源 foundation models。
Andrew Ng 借 Permissionless Innovation 讨论开源 AI,认为不必预先向政府请求许可才能创新,保护开源 AI 是保证创新自由的一部分。
Anthropic 的 Long-Term Benefit Trust 任命 Ben Bernanke 为新成员,继续强化其治理结构叙事。
Timnit Gebru 讽刺 Anthropic 和 OpenAI 可能 IPO 后制造新一批超级富豪,并质疑“用超级智能让世界更好”的乌托邦叙事。
Peter Steinberger 澄清自己被 OpenAI 雇佣,不是 OpenClaw;OpenClaw Foundation 保持独立,由 sponsor 支持并有全职团队维护。
Swyx 指出很多 agent labs 不愿承认使用中国模型,因为要卖给政府和国防客户;他赞赏 cog team 做了多语言宣传与审查 eval、posttraining 校正和低成本高速服务化。
研究线索集中在一个方向:让模型和 agent 的能力、偏差、进度和失败原因变得可观测、可放大、可训练。
Stanford AI Lab 介绍 Distill to Detect:通过蒸馏可疑模型和 base model 之间的偏移,把隐藏偏好放大成可见文本,再交给现有审计方法检测。
TRACE 是一种 agent 自我改进方法:agent 识别自身失败背后缺失的能力,并训练自己补齐。TRACE-trained Qwen3.6-27B 在 SWE-bench Verified 达到 73.2%。
LLM-as-a-Verifier 把 verification 作为新的 scaling axis,通过更细粒度反馈提升 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 表现。
Aurora 1.5 为天气、气候和能源应用增加 22 个变量、小时级时间分辨率和概率 ensemble forecasting,让 foundation model 更贴近真实世界预测场景。
OpenAI 用数学家 Bartosz 的案例展示 GPT-5.6 被用于解决此前不可解的数学问题,把模型发布和具体研究应用绑定在一起。
从写作风格、前端设计、slide 审美到游戏行业裁员,今天的反向信号都在提醒:效率提升不能替代真实判断和真实经营。
François Chollet 观察到新趋势:LLM 写作风格仍然可辨,但人类也开始自然模仿 LLM 风格,导致区分人和机器更难。
Swyx 赞赏 Theo keynote 使用手绘 Excalidraw/tldraw 风格,认为它比 Claude slop 式薄边框专业幻灯片更有人味、更简洁。
Zara 说她最希望 Codex 改进的是 frontend design,这也是阻止她更频繁使用 Codex 的关键问题。
Nikunj 认为 polished 正在越来越快地和 slop 绑定,接下来会出现向 raw and human 的回摆。
John Carmack 长文谈 Id Software 裁员:他难过但不急于愤怒,指出被喜爱不等于能长期成功,游戏必须在注意力和消费选择的残酷竞争中成立。
Carmack 继续表示,如果 Xbox 部门需要资金,他愿意提供 100 万美元 guarantee,让 TeamBeefVR 商业化 legacy open source games 的 VR 版本。