Peter 说 GPT 5.5、/goal、autoreview 和 crabbox 让他的提示从 30 到 60 分钟任务,延伸到 4 到 10 小时的长任务,关键能力变成会把工作交给 agents。
X 日报个人阅读
2026 年 5 月 31 日 · 周日
2026-05-30 08:00 至 2026-05-31 08:00(北京时间)
关注账号覆盖
条入选
个主题
晨间播报
这一期没有生成音频。
编辑导言
这一期不是公司发布日,而是工具使用者的一天。最密集的声音来自 AI Coding:Peter Steinberger 把 GPT 5.5、/goal、autoreview 和 crabbox 放在一起谈,重点不是模型多聪明,而是任务能不能被托付更久、审查能不能更像真实找 bug、runtime 优化能不能拿出数字。Greg Brockman 对 Codex 的轻描淡写,也落在同一条线上:AI 编程开始进入体感和流程,而不是只看 demo。
另一条线更冷:模型竞争被价格、token 消耗、benchmark 和企业成本重新框住。开源模型的可用性在上升,Claude、GPT 系列继续被放到新鲜 SWE 任务里比较,同时 Timnit Gebru 放大的医疗隐私、成本失控和 AGI 资本叙事提醒我们,AI 的真实部署会先碰到预算、责任和公共信任。
科研和现实世界系统提供了第三个侧面。ESMFold2、GPIC、FSD 里程都说明 AI 正在变成科学和工程系统的一部分,但 Yann LeCun 转发的科研经费政治化担忧也很关键:模型能力之外,制度环境同样决定技术能不能变成长期生产力。
01Agent 编程进入长任务
Codex、GPT 5.5、autoreview 和 OpenClaw 的连续信号,说明 AI Coding 的重点正从生成代码转向长任务托管、审查和可度量交付。
Peter 补充给出 autoreview 和 crabbox 链接,把上一条长任务经验落到具体工具链,而不是停留在口号。
Peter 观察到让 Codex 普通 review 时容易说没问题,但明确告诉它存在 bug 后会循环追查并发现问题,提示 prompt framing 会直接改变审查质量。
Greg Brockman 转述 Codex 构建体验,简短强调用 Codex build 的体感正在变好,这是产品体验层面的信号。
Peter 转发 OpenClaw 2026.5.28 对比 .27 的实测数据:冷启动快 14.5%、热启动快 16%、新安装体积小 52.8%,把 agent runtime 优化讲成可验证数字。
02模型竞争与成本账本
开源模型、Claude Opus 4.8 benchmark、前沿模型商业格局和企业用量成本,共同把模型竞争拉回性能、价格和治理账本。
Bindu Reddy 认为 open source AI 正指数级起飞,Kimi、DeepSeek、GLM 等模型已经适合约一半任务,开源 token 消耗接近追上 Gemini。
Peter 转发 SWE-rebench 更新:Claude Opus 4.8 在 March 到 May 的 110 个任务上达到 56.4%,与 GPT 5 和 GPT 5.5 成本表现放在同一张表里比较。
Peter 转发一组关于 OpenAI、Anthropic、Google、中国公司和 Nvidia 未来格局的冷判断,核心是最高档智能可能成为高价稀缺品。
Timnit Gebru 转发 AI consultant 关于客户单月误花 5 亿美元 Claude 用量的帖子,把企业 AI 使用从能力叙事拉回限额、预算和责任控制。
Zack Korman 讽刺有人相信几份 markdown 文件就足以理解并裁掉 90% 员工,提醒 AI 组织替代叙事可能低估真实工作复杂度。
03安全、隐私与公共责任
Timnit、Bengio、Chollet 的声音把 AGI 资金、医疗数据、公共善和人类中心性放在同一条风险线上。
Timnit Gebru 借 Anthropic 估值新闻讽刺 AI 公司用 ethics、safety 和 beneficial AGI 叙事包装巨额资本扩张。
Timnit 转发 ChatGPT Health 可上传医疗记录的提醒,核心态度很明确:不要把个人医疗记录上传给 AI chatbot。
Yoshua Bengio 分享自己在 Corriere 的进一步观点,延续他关于 AI、责任、公共善和全球机构角色的讨论。
François Chollet 写下“当人类转身离开人类,终结就会开始”,把 AI 讨论推回人类价值而非单纯能力竞赛。
04AI for Science 与现实部署
从蛋白质结构、视觉生成 benchmark 到 FSD 真实里程,AI 的另一条线索是进入科学工具和现实世界系统。
Yann LeCun 转发 ESMFold2 解析:模型开放权重、拥有 11 亿结构的 ESM Atlas、低延迟推理,并在抗体抗原等蛋白交互任务上有强表现。
Fei-Fei Li 转发 GPIC 作为 generative modeling 新 benchmark 的建议,强调它比 ImageNet 更贴近真实生成问题,且训练成本口径更有代表性。
Tesla AI 展示一位车主使用 FSD Supervised 行驶超过 7 万英里,信号在于自动驾驶能力继续通过真实里程积累说服力。
Yann 转发美国科研经费可能需要政治任命人员签批的担忧,科学进展的瓶颈不只在模型,也在资助制度和治理环境。
低信号与抓取缺口
本次按 2026-05-30 08:00 至 2026-05-31 08:00(北京时间)抓取 52 个账号第一页,52 个账号均成功,窗口内候选帖 24 条,纳入主报告 18 条。未抓取到窗口内更新的账号包括:Red_Xiao_、ManusAI、OfficialLoganK、AnthropicAI、tydsh、hugo_larochelle、GeminiApp、srush_nlp、soumithchintala、OriolVinyalsML、StanfordAILab、goodfellow_ian、ShunyuYao12、NotebookLM、berkeley_ai、KrugerSays、AIatMeta、wadefoster、ilyasut、seb_ruder、sundarpichai、EMostaque、kaifulee、ThomasOrTK、karpathy、demishassabis、lexfridman、JeffDean、elicollins、BaiduResearch、Metamind、IntelAI、IBMResearch、MSFTResearch、GoogleDeepMind、GoogleAI、rowancheung、ID_AA_Carmack、geoffreyhinton、AndrewYNg、OpenAI、sama。普通转推默认未纳入;仅当转推代表关注人主动放大强信号时纳入,例如 OpenClaw 性能、ChatGPT Health 隐私、AI 成本失控、ESMFold2、GPIC 和科研治理。未纳入的窗口内低相关内容包括普通政治经济转推、较弱个人调侃和上下文不足的短帖。失败账号为空。