她认为 GPT 5.6 发布后 Fable 的意义会下降,核心判断是 5.6 更便宜、更快、更务实,同时批评 Anthropic 模型在“thinking”上消耗过多 token。
X 日报个人阅读
2026 年 6 月 24 日 · 周三
2026-06-23 08:00 至 2026-06-24 08:00(北京时间)
关注账号覆盖
条入选
个主题
晨间播报
这一期没有生成音频。
编辑导言
本期是一个低信号但方向很集中的窗口:大模型竞争从单一榜单叙事转向成本、路由、开源窗口和场景分工。Bindu Reddy 连续谈到 GPT、Opus、Kimi、GLM 和 RouteLLM,François Chollet 则把问题拉回长期效率与符号学习。两条线合在一起,说明模型讨论已经不只是“谁更强”,而是“什么任务该用哪种系统形态”。
更值得展开的信号来自 Agent 和产品入口。Karpathy 把 Claude 描述成组织内持久、异步、带工具和上下文的实体,Manus 在做 sources 自动推荐,Google AI Studio 的 Android app 生成量被拿出来当增长信号,OpenAI 则在 DevDay 上继续强化开发者入口。AI 正在从聊天框走向工作流、团队协作和应用生产。
研究侧没有爆炸新闻,但有几条硬信号:Stanford AI Lab 的 Spiral 关注 test-time scaffold 与训练目标的不一致,Ian Goodfellow 提到小型 open weight model 加 structured search 在漏洞发现上有竞争力,Chollet 再次提醒复杂性是未来每次修改都要缴的税。本期的共同底色是:模型能力继续涨,但真正的分水岭越来越像系统设计、上下文治理和工程取舍。
01模型竞争进入路由时代
模型讨论从单点能力比较,转向成本、开源窗口、任务路由和前后端场景分工。
她介绍 RouteLLM:根据 prompt 自动路由到合适模型,在 Opus、GPT、Grok 等模型之间切换,并记住偏好,以实现成本与性能的权衡。
她称闭源 AI 处于暂停窗口,主张开源模型应趁机冲击排行榜,并提到将推进 Smaug-Agent 这类 trillion-parameter 模型。
她给出模型场景分工判断:Kimi 2.7 和 GLM 5.2 在前端 coding 上很强,GPT 5.5 仍更适合 backend,Opus 4.8 的前端优势下滑。
Chollet 判断 2040 年 AI 不会建立在今天这套 stack 上,当前系统存在数量级的数据和计算低效,近似最优 AI 将来自 symbolic learning。
02Agent 产品从工具走向组织入口
AI 产品形态正在从单点聊天转向持久上下文、资料引用、开发者活动和应用生成入口。
Karpathy 将 Claude 的新交互范式称为 LLM UI/UX 的第三次重设计:从网站、桌面 app,走向组织内持久、异步、带工具和上下文的实体。
Manus 更新 sources 能力:不再要求用户精确寻找 URL,而是根据需求推荐相关网页,并在后续任务中持续引用这些资料。
Logan 提到过去一个月里,用户已经在 Google AI Studio 中直接创建超过 100 万个原生 Android app,用数量展示应用生成入口的扩张。
他进一步把应用生成能力转化为个人行动号召:你也可以构建自己的 native app,延续 Google AI Studio 的低门槛开发叙事。
OpenAI 宣布 DevDay 2026 开放申请,地点为 San Francisco,时间为 9 月 29 日,申请截止 7 月 10 日。
Microsoft Research Podcast 讨论把 AI 看作不只是自动化人类已有任务的工具,而是打开新可能性的方式。
03研究与工程回到系统设计
从 test-time scaffold、漏洞搜索到代码复杂性,本期研究信号都指向“模型外系统”正在变得关键。
Stanford AI Lab 介绍 Spiral:既训练模型生成对 aggregator 集体有用的多样回答,也训练模型聚合这些回答,回应 test-time 多采样与训练目标不一致的问题。
Goodfellow 提到在 LLM 找漏洞方向,Aisle 早于 Mythos;工程上值得注意的是,小型 open weight model 加 structured search 也能在该任务上具备竞争力。
Chollet 强调软件复杂性是每次未来变更都要支付的税,优雅代码的价值不在审美,而在可维护性。
Zack 认为 cyber 并不神秘,组织应该采取必要步骤把基础工作做得更好,这条短评把安全问题重新拉回工程执行。
04生成式视频逼近全像素生产
Emad 的两条帖把中国视频模型、Seedance、Grok imagine 和实时生成串成一条创作基础设施演进线。
Emad 回顾自己离开 Stability AI 时曾预测中国实验室会在此时做出接近完美的视频,现在看到输出质量已接近“想象什么就生成什么”。
他继续评价 Seedance 2.5:多资产输入、更长输出等能力很强,并预计 Grok imagine 会跟进,最终“每个像素都将被生成”。
05叙事、市场与说服
几条非产品帖共同指向一个判断:地图、市场和安全倡议都会被集体叙事反向塑形。
Chollet 写道,地图是塑造其所描绘领土的主要力量,强调表征并非被动描述,而会反向改变现实。
他反驳市场效率神话,认为市场由人组成,个体与群体都受共享的非理性叙事驱动,并不会自然平均成理性整体。
Zack 讽刺部分 AI safety 论述在说服上适得其反,提醒好目标如果表达方式糟糕,也会伤害自身立场。
低信号与抓取缺口
第一类,窗口内零发帖且抓取正常的账号共 36 个:Red_Xiao_、AnthropicAI、tydsh、hugo_larochelle、drfeifei、GeminiApp、soumithchintala、OriolVinyalsML、ShunyuYao12、NotebookLM、berkeley_ai、KrugerSays、AIatMeta、ilyasut、seb_ruder、sundarpichai、kaifulee、ylecun、ThomasOrTK、timnitGebru、lexfridman、JeffDean、elicollins、BaiduResearch、Metamind、IntelAI、Tesla_AI、IBMResearch、GoogleDeepMind、GoogleAI、rowancheung、ID_AA_Carmack、Yoshua_Bengio、geoffreyhinton、AndrewYNg、sama。这些账号可以表述为本窗口内无更新。第二类,有发帖但没有任何帖子选入主报告的账号共 5 个:steipete、gdb、wadefoster、srush_nlp、demishassabis。它们不是无更新,而是因为内容主要是寒暄、短回复、裸链接或上下文不足,发了但未入选;另有 OfficialLoganK、OpenAI、EMostaque、ZackKorman、fchollet 等账号虽有部分帖子入选,但同账号下仍有低信号帖子未采用。第三类,抓取失败账号为无,全部 52 个账号 status 均为 ok。本次窗口 raw 帖 34 条,低于审计中的动态阈值 35 条,属于低信号日,但仍有足够内容形成模型竞争、Agent 产品形态、研究工程和生成式视频等主线。