Challen · X Following Dispatch No. 20260908

THE FOLLOWING

关注列表·北京时间24小时声音
2026-09-08 ★ 14 条 · 5 个主题 · 52 个账号 ★ COBALT GRID
编辑导言 FROM THE EDITOR

本期最值得展开的不是模型排名,而是能力展示之后还剩多少人工工作。Bindu Reddy 一边主张把日常任务交给便宜模型,一边抱怨 Astra 仍需要追问与测试;Peter Steinberger 则把矛头指向 PR 协作:双方都在用 Agent,人却还得充当修改意见的传话人。把这些帖子放在一起看,模型调用价格只是成本的一部分,返工与交接同样值得计算。

另一条线是如何为能力划边界。Zack Korman 主张,不必先预测出每一种事故,才有理由做好沙箱隔离;François Chollet 则要求把概念创新与机械搜索分开,不能凭解出一道题就宣布 AGI。药物机理可视化、声谱图识别与动态游戏提供了具体应用线索,但现有短帖不足以证明效果。治理部分保留 Timnit Gebru 对政策参与者及其思想背景的质疑,作为作者观点呈现,不把未展开核验的指控写成事实。

覆盖 52/52 个关注账号 · 14 条入选 · 聚为 5 个主题 · 由 AI 实时归纳,仅供参考
§ 第 Ⅰ 章 §
◆

选模型也要算返工

共 4 条

价格、任务完成度和人工交接共同决定 Agent 工作流的实际成本,个人体验不能替代统一评测。

Bindu Reddy @bindureddy

建议大多数日常任务优先使用 DeepSeek flash,把高能力模型留给复杂问题。她声称 DeepSeek 可覆盖 80% 的日常任务、便宜 100 倍,但帖文未给出测试方法或价格比较基准,这些数字应视为作者判断。

♥ 454⇄ 20✎ 58原帖 ↗
Bindu Reddy @bindureddy

给出个人模型梯队:Fable 5.1 与 Astra 并列第一,DeepSeek 与 GLM 5.3 flash 第二,Luna、Gemini、Grok 第三;认为 Meta、Kimi、Qwen 仍需改善成本或性能。帖文没有统一评测数据,不能当作客观榜单。

♥ 110⇄ 6✎ 15原帖 ↗
Bindu Reddy @bindureddy

在后续使用反馈中更偏向 Fable:她认为 Astra 难以独立完成完整构建,也不够善于预判后续问题,多数轮次仍需追加提示和测试。这里反映的是作者的实际使用感受,而非通用性能结论。

♥ 12⇄ 0✎ 6原帖 ↗
Peter Steinberger 🦞 @steipete

给上游项目提交 PR 后收到小改动要求,他质疑双方都使用 Agent 时,为什么还要由贡献者人工把审阅意见再次转交给自己的 Agent,再等对方 Agent 合并。问题指向 AI 编程协作中仍未消除的人工传话环节。

♥ 222⇄ 2✎ 47原帖 ↗
§ 第 Ⅱ 章 §
◆

沙箱先于事故预测

共 2 条

Agent 安全需要可检验的隔离边界,不能以无法预知具体事故为由推迟防护。

Zack Korman @ZackKorman

强调无需预先猜中 Agent 会造成哪一种损害,也能构建可靠沙箱;推荐 @akses_0x00 关于沙箱及 OpenAI / Hugging Face 事件的深度分析。当前原始材料仅包含推荐文字,未包含所链接文章的事件细节。

♥ 69⇄ 8✎ 7原帖 ↗
Zack Korman @ZackKorman

回顾自己六个月前关于 Agent 沙箱逃逸的分享,称曾让 AI 帮忙发现并突破有缺陷的沙箱,包括 NVIDIA nemoclaw 的两处问题。他的核心判断是,既然 AI 能在引导下利用漏洞,就应认真考虑它独立利用漏洞的风险;漏洞发现情况为作者自述。

♥ 1⇄ 0✎ 0原帖 ↗
§ 第 Ⅲ 章 §
◆

应用从文本走向交互

共 4 条

科学解释、声音识别与动态游戏给出具体应用方向,但短帖展示仍需与效果验证区分。

Greg Brockman @gdb

分享将 Astra 用于药物作用机理可视化的应用线索。现有帖文只有一句介绍,未给出具体药物、生成过程或科学准确性验证。

♥ 1.3k⇄ 84✎ 48原帖 ↗
Greg Brockman @gdb

介绍 Astra 从声谱图识别声音的用途,提供一个跨视觉与声音理解的任务方向;原始文字没有识别结果、样本或准确率,不能据此判断可靠性。

♥ 529⇄ 23✎ 53原帖 ↗
Emad @EMostaque

分享动态制作个人点击式冒险游戏的可能性,并期待更多面向全球的游戏。帖文未指明具体工具或技术方案,适合作为交互内容生成的应用线索。

♥ 47⇄ 1✎ 6原帖 ↗
Greg Brockman @gdb

介绍 ChatGPT Work 用于个人写作风格的场景。原帖未说明如何学习风格、使用哪些材料或具体配置,不据此推断产品机制。

♥ 518⇄ 17✎ 43原帖 ↗
§ 第 Ⅳ 章 §
◆

解题不等于发明

共 2 条

Chollet 将 AGI 的判断门槛放在概念突破与现实技术发明,而非仅仅完成既定题目。

François Chollet @fchollet

认为 AGI 的价值承诺一直是治癌、聚变等发明,因此只有 AI 真正具备提出新概念、新洞见和现实新技术的能力,才应该宣布实现 AGI。这是他提出的判定标准。

♥ 1.3k⇄ 98✎ 119原帖 ↗
François Chollet @fchollet

在回复中进一步区分解题路径:如果答案来自新的概念洞见,可以算作创新;如果只是机械搜索且没有新洞见,就仍是自动化证明。重点不是有没有解出来,而是是否产生了新的理解。

♥ 32⇄ 0✎ 1原帖 ↗
§ 第 Ⅴ 章 §
◆

谁在影响治理议程

共 2 条

Gebru 的讨论把注意力转向 AI 政策参与者的资金与思想背景,相关质疑需保留作者归属。

@timnitGebru (@dair-community.social/bsky.social) @timnitGebru

质疑 Bernie Sanders 在 AI 议题上倚重 Max Tegmark,并把 Future of Life Institute 的资金来源作为审视其政策影响力的切入点。资金与关系描述属于 Gebru 的主张,现有材料未包含独立核验依据。

♥ 473⇄ 168✎ 10原帖 ↗
@timnitGebru (@dair-community.social/bsky.social) @timnitGebru

推荐她参与撰写的 TESCREAL 论文,用于了解 longtermism 与 transhumanism,并将其与 Tegmark《Life 3.0》中的讨论联系起来。此帖提供思想背景的阅读入口,不等于论文结论已在本报核验。

♥ 65⇄ 16✎ 2原帖 ↗
低信号与缺口
第一类,窗口内零发帖:按审计中 status=ok 且 window_post_count=0 的口径,以下 44 个账号窗口内无更新:@Red_Xiao_、@ManusAI、@OfficialLoganK、@AnthropicAI、@tydsh、@hugo_larochelle、@drfeifei、@GeminiApp、@srush_nlp、@soumithchintala、@OriolVinyalsML、@StanfordAILab、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@KrugerSays、@AIatMeta、@wadefoster、@ilyasut、@seb_ruder、@sundarpichai、@kaifulee、@ylecun、@ThomasOrTK、@karpathy、@demishassabis、@lexfridman、@JeffDean、@elicollins、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@IBMResearch、@MSFTResearch、@GoogleDeepMind、@GoogleAI、@ID_AA_Carmack、@Yoshua_Bengio、@geoffreyhinton、@AndrewYNg、@OpenAI、@sama。 第二类,有发帖但未选入主报告:@rowancheung 窗口内发了 1 条,内容是旅行感受及 Astra 配额调侃,缺少可展开细节,因此发了但未入选,不能记为无更新。其余 7 个有发帖账号均至少入选 1 条;同账号中的重复论点、上下文不足的链接帖和低信号互动未全部收入。 第三类,抓取失败:无,52 个账号的审计状态均为 ok。 本次只基于冻结的 raw/audit 编辑,主报告收入 14 条关注帖,发布时间均在 2026-09-07 08:00 至 2026-09-08 08:00(北京时间)内;buildernews 的 5 条候选已审阅,本期未选用。账号无更新分类沿用审计口径;审计中的 first_page_covers_window_start 均为 false,因此抓取成功不等于已独立证明分页覆盖完整,本轮未重抓或补查。