X 日报个人阅读

2026 年 7 月 10 日 · 周五

2026-07-09 08:00 至 2026-07-10 08:00(北京时间)

52/52

关注账号覆盖

41

条入选

7

个主题

晨间播报

开车或走路时直接听;会记住播放速度和上次听到的位置。下载 MP3

编辑导言

这一期的主旋律很清楚:AI 产品正在从模型发布会,进入工作系统发布会。OpenAI 用 GPT-5.6、ChatGPT Work、桌面应用和 hosted sites 把模型能力包装成一套跨端工作入口;Meta 的 Muse Spark 1.1 也把多模态、computer use、多 agent 编排和代码工作流放在同一个叙事里。今天真正值得看的不是某个 benchmark 又涨了几分,而是这些能力开始被定义成“可以接住整段工作”的产品形态。

第二条线是开发者工作流的再组织。Manus 的 Branch、Claude Code 的 /checkup、Claude Tag 的多人协作、builder 圈对 Codex 单人化副作用的讨论,都指向同一个问题:AI 不是只替人写代码,而是在重写任务如何分叉、检查、协作和交付。模型越强,组织里越需要重新设计“人和人如何继续共同工作”。

第三条线更冷,但更长期:开源、AI 主权、治理结构、隐藏偏见检测、verification scaling 和 agent 自我训练都在同一天冒头。热闹的发布会背后,真正的基础设施问题仍然是:谁控制模型,模型如何被审计,agent 如何知道自己缺什么,以及成果如何从漂亮 demo 走进可验证的工作闭环。

01GPT-5.6 与 ChatGPT Work 成为头条

OpenAI 把新模型、Codex、桌面端和跨应用 agent 放进同一次发布,重点从问答能力转向完成工作。

OpenAI@OpenAI

OpenAI 宣布 Sol、Terra、Luna 组成的 GPT-5.6 模型族开始在 ChatGPT、Codex 和 API 中推出。

赞 9.1k转 1.0k评 451原帖 ↗
OpenAI@OpenAI

GPT-5.6 Sol 在 Agents' Last Exam 上达到 53.6,OpenAI 强调它以更低成本超过 Claude Fable 5,Terra 和 Luna 也主打成本效率。

赞 981转 92评 20原帖 ↗
Sam Altman@sama

Sam Altman 在直播中点出本次发布的三个产品重点:ChatGPT Work、新桌面应用和 hosted sites。

赞 8.8k转 417评 588原帖 ↗
Greg Brockman@gdb

Greg Brockman 将 GPT-5.6 概括为 Sol 加 Terra/Luna:面向 coding、知识工作、网络安全和科学任务,以更少 token 和更低成本完成工作。

赞 1.7k转 116评 110原帖 ↗
OpenAI@OpenAI

OpenAI 发布 ChatGPT Work,称它由 Codex 和 GPT-5.6 驱动,可以跨应用和文件执行动作,并长时间跟进项目直到形成成品。

赞 13.4k转 1.3k评 537原帖 ↗
OpenAI@OpenAI

ChatGPT Work 的 rollout 口径也很清楚:Web 和移动端先给 Pro、Enterprise、Edu,Plus 和 Business 随后;桌面端把 Chat、Work、Codex 合到同一个应用里。

赞 763转 47评 63原帖 ↗

02Agent 工作流开始产品化

多条信号显示,agent 产品竞争正在从模型调用转向上下文继承、分支、检查、多人协作和组织协同。

Manus@ManusAI

Manus 发布 Branch:可以把一段对话分叉成继承完整上下文的并行 session,让同一研究过程同时走向报告、幻灯片或投资人 brief。

赞 394转 31评 24原帖 ↗
OpenAI@OpenAI

OpenAI 对 ChatGPT Work 的定位是从回答问题转向跨 web、mobile、desktop 完成完整 workflow,并在用户控制下产出文档、deck、分析、网站和报告。

赞 850转 43评 18原帖 ↗
Greg Brockman@gdb

Greg Brockman 强调 ChatGPT Work 把 ChatGPT 和 Codex 合在一起,移动端、Web 和桌面端都能使用,不再要求电脑一直开着。

赞 1.5k转 100评 110原帖 ↗
Boris Cherny@bcherny外部信号

Claude Code 增加 /checkup,用来清理未用 skills、MCP、plugins,拆分 CLAUDE.md,关闭慢 hooks,升级版本并预批准常见只读命令。

赞 6.6k转 519评 206原帖 ↗
Cat Wu@_catwu外部信号

Cat Wu 预告 Claude Tag walkthrough,描述从单人 Claude Code 走到多人 Claude Tag:agent 可以监控 channel、主动工作、被团队共同 steering,并记住上周交代过的事。

赞 481转 33评 40原帖 ↗
Zara Zhang@zarazhangrui外部信号

Zara 观察到一个团队给所有人买 Codex Max 后,个人效率上去了,但人和人之间的协作变少,提出下一阶段应是 human-human-agent collaboration。

赞 238转 6评 72原帖 ↗

03多模态与 computer use 继续合流

OpenAI、Meta 和 Google 都在把实时语音、视觉输入、跨应用操作和多步上下文维持打包成下一代交互入口。

OpenAI@OpenAI

GPT-Live 已向 ChatGPT Go、Plus、Pro 用户完全推出,免费用户 rollout 也在进行中,OpenAI 要求用户更新 iOS 或 Android 应用体验。

赞 3.9k转 299评 292原帖 ↗
Greg Brockman@gdb

OpenAI 正在寻找 GPT-Live API 的 design partner,鼓励开发者做新的创意应用或接入已有产品。

赞 488转 29评 56原帖 ↗
AI at Meta@AIatMeta

Meta 发布 Muse Spark 1.1,同时开放新的 Meta Model API public preview,模型也进入 Meta AI app 和网页端的 Thinking mode。

赞 4.0k转 469评 213原帖 ↗
AI at Meta@AIatMeta

Muse Spark 1.1 被描述为面向 agentic tasks 的多模态推理模型,重点提升 tool use、computer use、coding 和多模态理解。

赞 333转 32评 17原帖 ↗
AI at Meta@AIatMeta

Meta 展示 Muse Spark 1.1 在多应用 computer-use workflow 中保持长会话上下文,并在脚本、直接 UI 操作和批处理动作之间选择策略。

赞 141转 10评 1原帖 ↗
Google Gemini@GeminiApp

Gemini Live 增加 Nano Banana 和 connected apps 支持,用户可以用摄像头展示内容,边说边规划和可视化项目,也能联动 Google Maps。

赞 145转 15评 10原帖 ↗

04模型选择变成路由和成本问题

围绕 GPT-5.6、Fable、Grok、Opus 的讨论不只是排名,而是把不同模型放到不同任务、价格和产品入口里动态调度。

Bindu Reddy@bindureddy

Bindu Reddy 给出模型体感排序:Fable 5 仍适合高难任务,GPT 5.6 接近 Opus 4.8 但更快更便宜,Grok 4.5 超过 GLM 5.2 但仍落后于 4.8。

赞 470转 16评 71原帖 ↗
Bindu Reddy@bindureddy

她提出用 Fable 5 做 advisor,其他 LLM 做 workers:GPT 5.6 sol 管后端编码,Opus 4.8 管前端和功能,Grok 4.5 管简单 coding。

赞 703转 32评 49原帖 ↗
Bindu Reddy@bindureddy

LiveBench AI 上 GPT 5.6 Sol 被她称为 benchmark leader,同时她仍认为 Fable 更适合复杂多轮 agentic loops。

赞 228转 22评 29原帖 ↗
Bindu Reddy@bindureddy

Abacus AI 推出 Max Mode,自动路由到 Fable 5 或 GPT 5.6 Sol,并把复杂 SaaS、custom workflows、移动应用和常驻交易服务器作为目标场景。

赞 304转 12评 13原帖 ↗
Aaron Levie@levie外部信号

Aaron Levie 认为最新模型越来越擅长复杂知识工作,尤其是法律、专业服务、医疗等垂直领域,Grok 4.5 在 cost 和 performance 上是重要新入口。

赞 68转 6评 14原帖 ↗
Guillermo Rauch@rauchg外部信号

Vercel 宣布 Grok 4.5 对所有 Vercel 客户可用,说明模型能力正被快速接入开发平台和部署平台。

赞 495转 28评 45原帖 ↗

05开源、治理与权力集中

在发布会热度之外,关注列表里仍有强烈的治理线索:AI 主权、开源保护、公益信托、IPO 批评和项目独立性。

Yann LeCun@ylecun

Yann LeCun 认为 AI 最大风险是少数专有 AI assistant 提供商的权力集中,AI 主权的解法只能是开源 foundation models。

赞 1.4k转 220评 71原帖 ↗
Andrew Ng@AndrewYNg

Andrew Ng 借 Permissionless Innovation 讨论开源 AI,认为不必预先向政府请求许可才能创新,保护开源 AI 是保证创新自由的一部分。

赞 148转 19评 38原帖 ↗
Anthropic@AnthropicAI

Anthropic 的 Long-Term Benefit Trust 任命 Ben Bernanke 为新成员,继续强化其治理结构叙事。

赞 1.1k转 102评 143原帖 ↗
@timnitGebru (@dair-community.social/bsky.social)@timnitGebru

Timnit Gebru 讽刺 Anthropic 和 OpenAI 可能 IPO 后制造新一批超级富豪,并质疑“用超级智能让世界更好”的乌托邦叙事。

赞 108转 24评 0原帖 ↗
Peter Steinberger 🦞@steipete

Peter Steinberger 澄清自己被 OpenAI 雇佣,不是 OpenClaw;OpenClaw Foundation 保持独立,由 sponsor 支持并有全职团队维护。

赞 3.3k转 92评 80原帖 ↗
Swyx@swyx外部信号

Swyx 指出很多 agent labs 不愿承认使用中国模型,因为要卖给政府和国防客户;他赞赏 cog team 做了多语言宣传与审查 eval、posttraining 校正和低成本高速服务化。

赞 118转 3评 9原帖 ↗

06验证、偏见检测与 agent 自我训练

研究线索集中在一个方向:让模型和 agent 的能力、偏差、进度和失败原因变得可观测、可放大、可训练。

Stanford AI Lab@StanfordAILab

Stanford AI Lab 介绍 Distill to Detect:通过蒸馏可疑模型和 base model 之间的偏移,把隐藏偏好放大成可见文本,再交给现有审计方法检测。

赞 6转 2评 0原帖 ↗
Stanford AI Lab@StanfordAILab

TRACE 是一种 agent 自我改进方法:agent 识别自身失败背后缺失的能力,并训练自己补齐。TRACE-trained Qwen3.6-27B 在 SWE-bench Verified 达到 73.2%。

赞 2转 1评 0原帖 ↗
Stanford AI Lab@StanfordAILab

LLM-as-a-Verifier 把 verification 作为新的 scaling axis,通过更细粒度反馈提升 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 表现。

赞 5转 1评 0原帖 ↗
Microsoft Research@MSFTResearch

Aurora 1.5 为天气、气候和能源应用增加 22 个变量、小时级时间分辨率和概率 ensemble forecasting,让 foundation model 更贴近真实世界预测场景。

赞 44转 10评 0原帖 ↗
OpenAI@OpenAI

OpenAI 用数学家 Bartosz 的案例展示 GPT-5.6 被用于解决此前不可解的数学问题,把模型发布和具体研究应用绑定在一起。

赞 503转 38评 15原帖 ↗

07反 AI slop 与真实工作文化

从写作风格、前端设计、slide 审美到游戏行业裁员,今天的反向信号都在提醒:效率提升不能替代真实判断和真实经营。

François Chollet@fchollet

François Chollet 观察到新趋势:LLM 写作风格仍然可辨,但人类也开始自然模仿 LLM 风格,导致区分人和机器更难。

赞 249转 16评 52原帖 ↗
Swyx@swyx外部信号

Swyx 赞赏 Theo keynote 使用手绘 Excalidraw/tldraw 风格,认为它比 Claude slop 式薄边框专业幻灯片更有人味、更简洁。

赞 69转 3评 22原帖 ↗
Zara Zhang@zarazhangrui外部信号

Zara 说她最希望 Codex 改进的是 frontend design,这也是阻止她更频繁使用 Codex 的关键问题。

赞 231转 1评 81原帖 ↗
Nikunj Kothari@nikunj外部信号

Nikunj 认为 polished 正在越来越快地和 slop 绑定,接下来会出现向 raw and human 的回摆。

赞 13转 0评 5原帖 ↗
John Carmack@ID_AA_Carmack

John Carmack 长文谈 Id Software 裁员:他难过但不急于愤怒,指出被喜爱不等于能长期成功,游戏必须在注意力和消费选择的残酷竞争中成立。

赞 6.5k转 634评 282原帖 ↗
John Carmack@ID_AA_Carmack

Carmack 继续表示,如果 Xbox 部门需要资金,他愿意提供 100 万美元 guarantee,让 TeamBeefVR 商业化 legacy open source games 的 VR 版本。

赞 1.3k转 100评 33原帖 ↗
低信号与抓取缺口

第一类,窗口内零发帖的账号:Red_Xiao_、tydsh、hugo_larochelle、drfeifei、srush_nlp、soumithchintala、OriolVinyalsML、goodfellow_ian、ShunyuYao12、NotebookLM、berkeley_ai、ilyasut、seb_ruder、sundarpichai、EMostaque、kaifulee、ThomasOrTK、karpathy、demishassabis、lexfridman、JeffDean、elicollins、BaiduResearch、Metamind、IntelAI、Tesla_AI、IBMResearch、GoogleDeepMind、GoogleAI、rowancheung、Yoshua_Bengio、geoffreyhinton。第二类,有发帖但未选入主报告的账号:OfficialLoganK、KrugerSays、wadefoster、ZackKorman。这些账号窗口内有更新,但主要是短回复、低上下文链接、单条管理经验或与本期主线关系较弱,因此写作时按“发了但未入选”处理,不能视为无更新。第三类,抓取失败的账号:无。本次窗口为 2026-07-09 08:00 至 2026-07-10 08:00(北京时间),关注列表 52 个账号全部抓取成功,主报告只纳入窗口内关注账号帖子,并少量混入 buildernews 中与本期主题高度相关的外部 builder 信号。