建议大多数日常任务优先使用 DeepSeek flash,把高能力模型留给复杂问题。她声称 DeepSeek 可覆盖 80% 的日常任务、便宜 100 倍,但帖文未给出测试方法或价格比较基准,这些数字应视为作者判断。
X 日报个人阅读
2026 年 9 月 8 日 · 周二
2026-09-07 08:00 至 2026-09-08 08:00(北京时间)
关注账号覆盖
条入选
个主题
晨间播报
开车或走路时直接听;会记住播放速度和上次听到的位置。下载 MP3
编辑导言
本期最值得展开的不是模型排名,而是能力展示之后还剩多少人工工作。Bindu Reddy 一边主张把日常任务交给便宜模型,一边抱怨 Astra 仍需要追问与测试;Peter Steinberger 则把矛头指向 PR 协作:双方都在用 Agent,人却还得充当修改意见的传话人。把这些帖子放在一起看,模型调用价格只是成本的一部分,返工与交接同样值得计算。
另一条线是如何为能力划边界。Zack Korman 主张,不必先预测出每一种事故,才有理由做好沙箱隔离;François Chollet 则要求把概念创新与机械搜索分开,不能凭解出一道题就宣布 AGI。药物机理可视化、声谱图识别与动态游戏提供了具体应用线索,但现有短帖不足以证明效果。治理部分保留 Timnit Gebru 对政策参与者及其思想背景的质疑,作为作者观点呈现,不把未展开核验的指控写成事实。
01选模型也要算返工
价格、任务完成度和人工交接共同决定 Agent 工作流的实际成本,个人体验不能替代统一评测。
给出个人模型梯队:Fable 5.1 与 Astra 并列第一,DeepSeek 与 GLM 5.3 flash 第二,Luna、Gemini、Grok 第三;认为 Meta、Kimi、Qwen 仍需改善成本或性能。帖文没有统一评测数据,不能当作客观榜单。
在后续使用反馈中更偏向 Fable:她认为 Astra 难以独立完成完整构建,也不够善于预判后续问题,多数轮次仍需追加提示和测试。这里反映的是作者的实际使用感受,而非通用性能结论。
给上游项目提交 PR 后收到小改动要求,他质疑双方都使用 Agent 时,为什么还要由贡献者人工把审阅意见再次转交给自己的 Agent,再等对方 Agent 合并。问题指向 AI 编程协作中仍未消除的人工传话环节。
02沙箱先于事故预测
Agent 安全需要可检验的隔离边界,不能以无法预知具体事故为由推迟防护。
强调无需预先猜中 Agent 会造成哪一种损害,也能构建可靠沙箱;推荐 @akses_0x00 关于沙箱及 OpenAI / Hugging Face 事件的深度分析。当前原始材料仅包含推荐文字,未包含所链接文章的事件细节。
回顾自己六个月前关于 Agent 沙箱逃逸的分享,称曾让 AI 帮忙发现并突破有缺陷的沙箱,包括 NVIDIA nemoclaw 的两处问题。他的核心判断是,既然 AI 能在引导下利用漏洞,就应认真考虑它独立利用漏洞的风险;漏洞发现情况为作者自述。
03应用从文本走向交互
科学解释、声音识别与动态游戏给出具体应用方向,但短帖展示仍需与效果验证区分。
分享将 Astra 用于药物作用机理可视化的应用线索。现有帖文只有一句介绍,未给出具体药物、生成过程或科学准确性验证。
介绍 Astra 从声谱图识别声音的用途,提供一个跨视觉与声音理解的任务方向;原始文字没有识别结果、样本或准确率,不能据此判断可靠性。
分享动态制作个人点击式冒险游戏的可能性,并期待更多面向全球的游戏。帖文未指明具体工具或技术方案,适合作为交互内容生成的应用线索。
介绍 ChatGPT Work 用于个人写作风格的场景。原帖未说明如何学习风格、使用哪些材料或具体配置,不据此推断产品机制。
04解题不等于发明
Chollet 将 AGI 的判断门槛放在概念突破与现实技术发明,而非仅仅完成既定题目。
认为 AGI 的价值承诺一直是治癌、聚变等发明,因此只有 AI 真正具备提出新概念、新洞见和现实新技术的能力,才应该宣布实现 AGI。这是他提出的判定标准。
在回复中进一步区分解题路径:如果答案来自新的概念洞见,可以算作创新;如果只是机械搜索且没有新洞见,就仍是自动化证明。重点不是有没有解出来,而是是否产生了新的理解。
05谁在影响治理议程
Gebru 的讨论把注意力转向 AI 政策参与者的资金与思想背景,相关质疑需保留作者归属。
质疑 Bernie Sanders 在 AI 议题上倚重 Max Tegmark,并把 Future of Life Institute 的资金来源作为审视其政策影响力的切入点。资金与关系描述属于 Gebru 的主张,现有材料未包含独立核验依据。
推荐她参与撰写的 TESCREAL 论文,用于了解 longtermism 与 transhumanism,并将其与 Tegmark《Life 3.0》中的讨论联系起来。此帖提供思想背景的阅读入口,不等于论文结论已在本报核验。
低信号与抓取缺口
第一类,窗口内零发帖:按审计中 status=ok 且 window_post_count=0 的口径,以下 44 个账号窗口内无更新:@Red_Xiao_、@ManusAI、@OfficialLoganK、@AnthropicAI、@tydsh、@hugo_larochelle、@drfeifei、@GeminiApp、@srush_nlp、@soumithchintala、@OriolVinyalsML、@StanfordAILab、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@KrugerSays、@AIatMeta、@wadefoster、@ilyasut、@seb_ruder、@sundarpichai、@kaifulee、@ylecun、@ThomasOrTK、@karpathy、@demishassabis、@lexfridman、@JeffDean、@elicollins、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@IBMResearch、@MSFTResearch、@GoogleDeepMind、@GoogleAI、@ID_AA_Carmack、@Yoshua_Bengio、@geoffreyhinton、@AndrewYNg、@OpenAI、@sama。 第二类,有发帖但未选入主报告:@rowancheung 窗口内发了 1 条,内容是旅行感受及 Astra 配额调侃,缺少可展开细节,因此发了但未入选,不能记为无更新。其余 7 个有发帖账号均至少入选 1 条;同账号中的重复论点、上下文不足的链接帖和低信号互动未全部收入。 第三类,抓取失败:无,52 个账号的审计状态均为 ok。 本次只基于冻结的 raw/audit 编辑,主报告收入 14 条关注帖,发布时间均在 2026-09-07 08:00 至 2026-09-08 08:00(北京时间)内;buildernews 的 5 条候选已审阅,本期未选用。账号无更新分类沿用审计口径;审计中的 first_page_covers_window_start 均为 false,因此抓取成功不等于已独立证明分页覆盖完整,本轮未重抓或补查。