Challen · X Following Dispatch No. 20260802

THE FOLLOWING

关注列表·北京时间24小时声音
2026-08-02 ★ 18 条 · 5 个主题 · 52 个账号 ★ COBALT GRID
编辑导言 FROM THE EDITOR

这一天最值得看的,不是哪家模型又多赢了一道题,而是 Agent 正从聊天窗口走进生产系统。自改进 Agent、可随时介入的云端浏览器、Issue 到 Release 的自动闭环,以及决定成本和可靠性的 harness,指向同一个变化:模型能力仍是底座,但真正拉开差距的开始变成任务如何拆解、路由、观察和纠偏。

另一条线索更有张力。AI 在数学研究和专用任务上继续抬高能力上限,人们同时追问安全社区为何被排除、开放权重风险该依据预测还是证据,以及 Agent 进入协作工具后会不会反而隔开人与人。能力与边界不再是两场讨论,它们已经在同一套工作流里碰面。

覆盖 52/52 个关注账号 · 18 条入选 · 聚为 5 个主题 · 由 AI 实时归纳,仅供参考
§ 第 Ⅰ 章 §
◆

Agent 工厂成形

共 6 条

Agent 的竞争焦点正从单次回答转向可持续运行、人工介入和端到端交付闭环。

Bindu Reddy @bindureddy

发布 AutoBots,主张用多模型路由构建递归自改进 Agent:简单任务交给 DeepSeek Flash 4,困难任务交给 Fable 5,并把运行经验反馈到后续执行中。

♥ 568⇄ 41✎ 70原帖 ↗
Peter Steinberger 🦞 @steipete

模型 5.5 在长任务中不再容易被新增指令打乱,用户可以边执行边追加工作,让 Agent 依次消化,不必先维护严格队列。

♥ 353⇄ 10✎ 43原帖 ↗
Greg Brockman @gdb

ChatGPT Work 的云端浏览器把 Agent 的操作过程变成可观察界面,用户既能持续监控,也能在真实应用中随时接管。

♥ 725⇄ 26✎ 96原帖 ↗
Swyx @swyx

在更强模型时代仍坚持使用 /loop 和 /goal:它们适合兼顾可控性与自主性,也适合让 Agent 在开放目标下自行生成后续循环。

♥ 10⇄ 1✎ 6原帖 ↗
Nan Yu @thenanyu

Linear 中常见的 Issue 到 Agent、PR、Release 闭环已有约 30% 的 bug 能跑完全程,但前提是先用 Datadog、Sentry MCP 深挖根因,证据不足时停止修复并向报告人补问。

♥ 96⇄ 2✎ 5原帖 ↗
Guillermo Rauch @rauchg

软件项目会逐步变成 Agent 工厂,维护者的核心工作不再是亲自处理每个 Issue,而是设计能稳定产出高质量产品的循环和准入标准。

♥ 1.1k⇄ 56✎ 59原帖 ↗
§ 第 Ⅱ 章 §
◆

研究上限上移

共 3 条

前沿模型开始以研究成果、数学可靠性和专用任务效率证明能力,而不只是刷新通用榜单。

Greg Brockman @gdb

OpenAI 内部版 Astra 被用于解决十项数学与理论计算机科学的重要进展,按 Sol API 价格估算总成本约 2000 美元。

♥ 5.2k⇄ 305✎ 202原帖 ↗
Emad @EMostaque

他认为 GPT 5.6 Sol 已把数学错误压到极低水平,并判断纯研究项目距离自动化只差一套合适的 harness loop。

♥ 376⇄ 19✎ 27原帖 ↗
Amjad Masad @amasad

展示一个约 1500 Elo 的 8B 棋类模型,称其能稳定击败前沿模型与 Stockfish level 0,每步只需 1 至 2 秒,强调小模型在专用任务上的速度优势。

♥ 63⇄ 0✎ 12原帖 ↗
§ 第 Ⅲ 章 §
◆

AI 要靠近人

共 3 条

Agent 越深入协作和家庭场景,界面设计越需要维护真实关系,而不是增加一层代理隔膜。

Greg Brockman @gdb

OpenAI 内部有人让 ChatGPT 通过 Slack 向同事求助,却引发明显反感。相同工作若由本人开口通常会被接受,说明协作价值仍建立在人际关系而非任务转发上。

♥ 6.4k⇄ 228✎ 389原帖 ↗
Zara Zhang @zarazhangrui

从 Anthropic 团队大量 PR 由 Claude Tag 发起的案例出发,她判断 Agent 界面正从终端、桌面应用迁入 Slack 等既有协作空间,关键是让 Agent 去找用户。

♥ 32⇄ 5✎ 4原帖 ↗
Sam Altman @sama

提出把家庭日历和孩子兴趣交给 ChatGPT Work,每天上学路上自动生成一档家庭播客,将比赛、生日和新闻编成孩子能听的内容。

♥ 8.0k⇄ 240✎ 2.1k原帖 ↗
§ 第 Ⅳ 章 §
◆

Harness 决定账本

共 3 条

当任务扩展到数千万乃至上亿 token,预算、路由、容灾和可观测性成为模型能力之外的第二控制面。

Aaron Levie @levie

随着任务的 token 规模持续放大,harness 如何拆分工作并在正确时机路由到正确模型,将同时决定准确率与成本。

♥ 89⇄ 10✎ 13原帖 ↗
Guillermo Rauch @rauchg

AI Gateway 把每个 key、团队和项目的预算控制,与故障切换、模型选择和实时可观测性放到同一层基础设施中,目标是让 AI 投入可管理。

♥ 119⇄ 5✎ 22原帖 ↗
Thibault Sottiaux @thsottiaux

宣布重置 Codex 与 ChatGPT Work 的使用额度,直接把更多并发 Agent 线程作为周末使用场景,侧面显示算力额度已成为产品体验的一部分。

♥ 15.1k⇄ 869✎ 2.2k原帖 ↗
§ 第 Ⅴ 章 §
◆

安全需要证据

共 3 条

安全讨论的分歧正在从口号转向参与机制、真实案例和可证伪的能力判断。

Zack Korman @ZackKorman

批评大型 AI 实验室频繁谈论 cybersecurity,却很少真正与安全社区协作,认为参与机制与公开表态之间存在落差。

♥ 569⇄ 48✎ 54原帖 ↗
Zack Korman @ZackKorman

分享一场关于 AI security 的播客讨论,把实验室近期直接参与攻击性安全行动的争议作为新的现实背景。

♥ 23⇄ 2✎ 2原帖 ↗
Zack Korman @ZackKorman

评论 Thinking Machines 的开放权重安全文章:虽然不同意其中不少结论,但认可实验室承认对危险能力的预测可能出错,安全判断应回到证据。

♥ 40⇄ 3✎ 4原帖 ↗
低信号与缺口
第一类,窗口内零发帖:@Red_Xiao_、@ManusAI、@AnthropicAI、@tydsh、@hugo_larochelle、@drfeifei、@srush_nlp、@soumithchintala、@OriolVinyalsML、@StanfordAILab、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@KrugerSays、@AIatMeta、@wadefoster、@ilyasut、@seb_ruder、@sundarpichai、@kaifulee、@ylecun、@ThomasOrTK、@karpathy、@demishassabis、@timnitGebru、@lexfridman、@JeffDean、@elicollins、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@IBMResearch、@MSFTResearch、@GoogleDeepMind、@GoogleAI、@fchollet、@rowancheung、@ID_AA_Carmack、@Yoshua_Bengio、@geoffreyhinton、@AndrewYNg、@OpenAI,共 44 个账号在窗口内无更新。第二类,有发帖但未选入主报告:@OfficialLoganK、@GeminiApp、@sama,共 3 个账号;其窗口内内容主要是简短感想、互动回复或缺少上下文的低信息量表达,因此是发了但未入选,不是无更新。第三类,抓取失败:无,52 个关注账号均抓取成功。本次关注列表严格采用 2026-08-01 08:00 至 2026-08-02 08:00 的北京时间窗口,窗口内 raw 帖 24 条,属于低信号日;另混编 9 条 buildernews 近一日外部 builder 信号,它们不参与精确 24 小时窗口与账号缺口统计。