编辑导言
FROM THE EDITOR
这一期不是产品发布清单,而是几种预期的碰撞。Logan Kilpatrick 把自主创收 Agent 的规模化押在 2027 年,Bindu Reddy 更关心模型能力和价格,而非 Codex 增加多少功能。两者都在谈下一步,但前者是预测,后者是愿望清单,不能读成已经兑现的收入或已经官宣的发布。
更值得展开的是工程现场:Peter Steinberger 打算让 Codex 判断哪些测试需要运行,以减轻 CI 负担;Zack Korman 则提醒,大团队没有察觉安全事故,不代表事故不存在。编辑看来,降本方案与风险发现能力应当一起讨论。LeCun 对机器智能被高估的提醒,以及 Timnit Gebru 对推理评测稳健性的质疑,也指向同一个阅读习惯:把有用、表现好和已经被证明可靠分开。本期是低信号日,从 25 条窗口内帖子中保留 6 条,不用重复争论和上下文不足的短回复填版。
§
第 Ⅰ 章
§
让 Agent 参与测试决策可能降低 CI 负担,但未察觉事故不能替代安全验证。
Peter Steinberger 🦞
@steipete
Peter 表示,虽然 Blacksmith 的赞助帮助很大,团队仍需要分散负载。他计划让 Codex 判断哪些测试确实需要运行,大幅削减 CI,并按小时运行测试。这是拟采取的方案,帖文没有提供实施效果或漏测数据。
Zack Korman
@ZackKorman
Zack 提醒,足够大的技术团队在使用 AI agents 时,很可能也存在尚未被发现的安全事故。他质疑的是把“没有察觉问题”当成安全依据的做法;帖文本身没有列出可核验的具体事故。
§
第 Ⅱ 章
§
自主创收的预期与模型降价诉求同时出现,但预测、建议与正式发布需要分开阅读。
Logan Kilpatrick
@OfficialLoganK
Logan 预测,2027 年将出现规模化自主创收的 agents 或微型公司,能否盈利则仍打问号。他称今天已有小规模尝试,但还存在不少粗糙环节;这是个人趋势判断,并非已验证的规模化商业成绩。
Bindu Reddy
@bindureddy
Bindu 为 OpenAI Dev Day 列出个人期待:推出 Astra 6.1 或 6.5、承诺发布比 Astra 更大的 Bel,以及将 Astra 和 SOL 5.6 的价格降低约一半。她认为模型本身比 Codex 新增零散功能更重要。这是建议清单,不是官方发布消息。
§
第 Ⅲ 章
§
能力判断既要防止从实用性直接推断智能,也要检验评测结果对数据变化是否稳健。
Yann LeCun
@ylecun
LeCun 在一条回应中提醒,人们高估有用机器的智能并非第一次。现有文本表达的是对能力判断的警惕,没有指明具体模型,也未给出新的实验结果。
@timnitGebru (@dair-community.social/bsky.social)
@timnitGebru
Timnit Gebru 称,她近期在采访中援引过关于“推理”能力评估的研究:对评测数据做简单变化,结果就可能大幅下滑。她据此批评媒体照搬能力叙事;本条素材未附研究细节,不能据此断言某个具体模型已被证伪。
低信号与缺口
第一类「窗口内零发帖」:依据审计中 status=ok 且 window_post_count=0 的口径,共 46 个账号窗口内无更新:@Red_Xiao_、@ManusAI、@AnthropicAI、@tydsh、@hugo_larochelle、@drfeifei、@GeminiApp、@srush_nlp、@soumithchintala、@OriolVinyalsML、@StanfordAILab、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@KrugerSays、@AIatMeta、@wadefoster、@ilyasut、@seb_ruder、@sundarpichai、@EMostaque、@kaifulee、@ThomasOrTK、@karpathy、@demishassabis、@lexfridman、@JeffDean、@elicollins、@gdb、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@IBMResearch、@MSFTResearch、@GoogleDeepMind、@GoogleAI、@fchollet、@rowancheung、@ID_AA_Carmack、@Yoshua_Bengio、@geoffreyhinton、@AndrewYNg、@OpenAI、@sama。
第二类「有发帖但未选入主报告」:无。窗口内有发帖的 6 个账号均至少入选 1 条:@steipete(4 条选 1 条)、@OfficialLoganK(1 条选 1 条)、@ZackKorman(4 条选 1 条)、@bindureddy(2 条选 1 条)、@ylecun(3 条选 1 条)、@timnitGebru(11 条选 1 条)。其余 19 条帖子未入选,不代表这些账号无更新;主要涉及短回复、重复观点、仅含链接的文本,以及缺少可核验上下文的争论。
第三类「抓取失败」:无。审计中 52 个账号的 status 均为 ok。
本次为低信号日:窗口内 raw 共 25 条,低于上游审计的动态阈值 35 条,主报告选取 6 条,分为 3 个主题。本期未采用 buildernews 候选料,不将外部 feed 作者纳入账号统计。主报告仅纳入 2026-09-27 08:00 至 2026-09-28 08:00(北京时间)的关注帖;账号分类沿用已有审计,抓取成功不额外证明所有账号的分页覆盖完整,本次未重新抓取或修改原始审计。