ChatGPT Work 可以直接承接周期性任务,产品入口开始从临时对话转向持续执行。
X 日报个人阅读
2026 年 8 月 3 日 · 周一
2026-08-02 08:00 至 2026-08-03 08:00(北京时间)
关注账号覆盖
条入选
个主题
晨间播报
开车或走路时直接听;会记住播放速度和上次听到的位置。下载 MP3
编辑导言
这一期最清晰的主旋律,不是模型又多答对了几道题,而是 AI 开始接管有时间跨度的工作。定时任务、求职筛选、会议整理、财务归类和邮件界面改造,都在把一次问答改造成持续运行的个人流程。真正的产品分水岭,正在从回答质量转向能否进入环境、调用工具并把结果交付回来。
另一条线索来自能力边界。Opus 5 用两小时和 5500 行代码生成《指环王》场景,展示了机器在超长定制任务上的耐力,也暴露了它无法高效观看、试玩和审计自身作品的短板。与此同时,François Chollet 把当前进展归因于 test-time adaptation,而非静态 next-token scaling 的自然延伸。模型变强了,但让它可靠地看见自己的工作,仍是下一段工程主线。
工具层也出现了更务实的分化:简单任务用便宜小模型,复杂任务再调高档位;Skills、issue、agent loop 正在成为人和 coding agent 之间的新接口。行业关注点正从“哪个模型最强”转向“怎样把不同能力编排成成本可控、能继续执行的系统”。
01Agent 进入真实工作流
AI 的价值重心正从一次性回答,转向能按时运行、跨工具执行并交付结果的持续流程。
多年忍受 Gmail 界面问题后,他直接让 agent 安装解决方案。关键变化不是获得建议,而是 agent 能进入本机环境完成改造。
一个个人 AI 招聘助手每天早晨搜索职位、评分、为最佳岗位定制简历,并在用户醒来前发送结果。
本地 agent 通过 Telegram 接收会议录音,完成转写、说话人识别、行动项提取和任务归档,单次成本约 0.01 美元。
Claude 构建的流程读取银行账单、自动归类支出并生成看板,用定制自动化替代每月 38 美元的 QuickBooks 订阅。
02长时生成与自检短板
长时任务把模型耐力转化为全新创作空间,也让视觉理解、试玩和结果审计成为明显瓶颈。
他给 Opus 5 一段《指环王》文本、约 100 万 token 和两小时执行时间,模型写出 5500 行 Three.js 代码生成可动画场景。实验说明超定制世界的边际成本正在快速下降,但模型无法高效观看视频或试玩作品,只能依赖缓慢截图检查,导致明显瑕疵。
Karpathy 随后公开了可在浏览器运行和 fork 的源码,把一次模型能力演示变成可继续改造的作品。
他赞同用程序化代码负责分镜和控制,再用 video-to-video 模型处理纹理与视觉表现,组合确定性结构和生成式外观。
ChatGPT 正被用于构建交互式教育工具,生成能力从静态内容进一步进入可操作、可反馈的学习环境。
03模型分层与开源窗口
模型选择正在从单一榜单转向按任务难度、成本和使用体验动态路由。
DeepSeek Flash 是表现不错的小模型,但 benchmark 优化痕迹较重,实际定位更接近 GPT-Luna,而非下一代旗舰能力。
她建议按任务复杂度选择模型:简单任务用便宜模型,困难任务再升级。用 Flash 硬扛复杂任务会失败,用旗舰模型处理简单任务则可能贵 100 倍。
她看好 8 月的开源模型窗口,预期 GLM 5.5 强化多模态,DeepSeek Pro 以更低成本逼近 Kimi K3,企业忽视开源路线的代价会增加。
他认为 Opus 5 的人格和写作体验不如 Opus 4.6,主要问题是回复过长、Claude-speak 增多且判断感过强。模型升级并不必然带来更好的长期交互体验。
04推理范式越过静态扩展
争论焦点已从参数规模是否继续有效,转向 test-time adaptation 如何改变系统的推理上限。
Chollet 认为 AI 为绕开 deep learning 的停滞先采用了第一类补丁,并在 2024 年底快速普及;长期看,系统走向第二类补丁不可避免。
即使训练规模较 2019 年增长约 10 万倍,不使用 test-time compute 的 base LLM 在 ARC-1 未见任务上仍表现不佳。他据此判断,先进推理来自测试时适应,而非单次静态 next-token prediction 的继续扩展。
他明确修正了旧观点:对 base LLM 的能力上限批评不应直接套用到带 test-time adaptation 的系统,两者更像蒸汽列车与电气化高铁,共用轨道但工作原理已明显不同。
Emad 对 memory 路线并不乐观。这个简短判断提醒业界,长期上下文并不等于可靠记忆,具体论证仍待他后续展开。
AI 在日常生产力与数学、科学、法律、编程等深领域的能力将进一步分化。深领域能力可能快速上升,但只有接入专业数据和工作流后,能力盈余才会转化为真实突破。
05Skills 成为协作接口
coding agent 的下一步不只是写更多代码,而是通过 Skills、issue 和可续跑 loop 接收边界清晰的工作。
Peter 直接反驳对 Skills 的轻视,认为 Skills 在 agent 工作流中非常有用。
一个 Claude Skill 能调查可疑的 Google Business Profile,收集证据并生成可直接提交的举报材料,把重复调查封装成稳定能力。
他设想在 GitHub issue 中写清 spec 并质押 token,maintainer 接受后,由请求方付费的云端 coding agent 原样执行 issue,以减少缺乏上下文的低质量 PR。
Swyx 关注面向 AI 时代重新设计编程语言,并提出“容忍 slop”可能比单纯抵制 slop 更有价值。系统需要从运行机制上吸收生成代码的不稳定性。
低信号与抓取缺口
第一类,窗口内零发帖:@Red_Xiao_、@ManusAI、@OfficialLoganK、@AnthropicAI、@tydsh、@hugo_larochelle、@drfeifei、@GeminiApp、@srush_nlp、@soumithchintala、@OriolVinyalsML、@StanfordAILab、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@KrugerSays、@AIatMeta、@wadefoster、@ilyasut、@seb_ruder、@sundarpichai、@kaifulee、@ylecun、@ThomasOrTK、@demishassabis、@lexfridman、@JeffDean、@elicollins、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@IBMResearch、@MSFTResearch、@GoogleDeepMind、@GoogleAI、@ID_AA_Carmack、@Yoshua_Bengio、@geoffreyhinton、@AndrewYNg、@OpenAI、@sama,共 43 个账号,审计状态均为 ok,window_post_count 为 0。第二类,有发帖但未选入主报告:@ZackKorman、@timnitGebru,共 2 个账号;两者窗口内确有发帖,但内容主要是依赖外部上下文的争论、简短评论或与本期主线关联较弱,因此属于发了但未入选,不能视为无更新。第三类,抓取失败:无,52 个账号状态均为 ok。本次关注列表主报告严格使用 2026-08-02 08:00 至 2026-08-03 08:00 的北京时间窗口;另混编 4 条 buildernews 近一日外部 builder 信号,它们不参与关注账号的窗口与缺口统计。