本期最值得展开的不是模型又被喊成了 AGI,而是使用规模上来之后,哪些旧假设开始失效。Peter Steinberger 发现,原来够用的 SQLite 同步访问,在单个 Agent 并行运行 50 个会话、团队共同使用时成了限制;他借助 Astra 推进异步重构的经历,比一句能力赞叹更能说明工程现场正在发生什么。另一边,Bindu Reddy 把模型选择落到了反复改提示词的时间和账单上:榜单表现与实际使用体验,仍需分开判断。
安全讨论也需要把证据层次拆开。Jeff Dean 分享的是 Waymo 严重伤害事故率的里程统计,Zack Korman 表达的是对网络安全隔离能力的信心,Timnit Gebru 质疑的则是 AI 生存风险叙事如何获得公共话语权。它们不是同一种证据,不能相互替代。本期保留这些差别,不把个人体验写成模型定论,也不把立场表达写成已经证实的事件。
从单人助手走向团队并行使用,数据库访问方式和运行位置都需要重新评估。
Steinberger 复盘 OC 迁移到 SQLite 时采用同步数据库访问的设计失误:原先只向 Slack 或 iMessage 汇报时尚可,如今一个 Agent 可能并行跑 50 个会话,团队也共同使用,限制开始显现。他称,通过 Astra 的 /goal 已落地 575 个 PR,将系统逐步迁往 async workers,并边改边发布。
在一则部署讨论的回复中,Steinberger 建议不必专门准备一台 Mini:可以把服务放在 VPS 上,通过 Tailscale 连接自己的电脑,再让它执行 computer use。这提供了一种将远端运行与本机操作分开的部署思路。
模型是否值得用,除了 benchmark,还取决于提示词迭代、人力时间和实际账单。
Reddy 分享个人试用反馈:Opus 5.5 相比 Fable 需要更多轮提示词调整,最终账单约为使用 Fable 时的两倍,还占用了额外时间,因此决定回到 Fable 5.1。原帖未提供任务样本或受控测试,这是一则个人工作流中的成本体验。
Reddy 质疑 DeepSeek 最新 Flash 模型的 benchmark 表现与日常使用体验存在落差,并不认同其达到 Fable、Astra 水平的说法。原帖没有给出具体失败案例或评测数据,应视为待验证的使用者意见,而非性能排名结论。
Reddy 对 OpenAI Dev Day 的愿望是将 Astra 价格降低 50%,并发布 Astra 6.5。这里表达的是开发者对价格与能力升级的期待,不是已经宣布的降价或发布消息。
事故统计、隔离能力判断与公共叙事批评各有边界,讨论 AI 安全不能混用这些依据。
Dean 分享 Waymo 严重伤害事故率与人类驾驶的比较:据他引用的最新数据,累计 2.7 亿英里对应约 20 倍的安全优势;2026 年 3 月的 1.7 亿英里数据对应约 13 倍,更早约为 10 倍。原帖没有展开统计方法、道路条件或人类驾驶基准,不能据此外推所有驾驶场景。
Korman 呼吁更多网络安全专家公开说明现有防护的价值。他认为,即使 AI 很擅长发现 zero-day 漏洞,也仍然能够被限制在安全边界内。这是关于可控性的立场判断,原帖未提供具体隔离方案或验证结果。
Gebru 批评 Bernie Sanders 对部分 AI 生存风险倡导者的专家背书,并质疑这类叙事在主流媒体和联合国等公共场域的影响力。她认为这些风险说法具有虚构性;这是作者的批评立场,所附阅读材料未在本期独立核验。