本期是一个低信号但方向很集中的窗口:大模型竞争从单一榜单叙事转向成本、路由、开源窗口和场景分工。Bindu Reddy 连续谈到 GPT、Opus、Kimi、GLM 和 RouteLLM,François Chollet 则把问题拉回长期效率与符号学习。两条线合在一起,说明模型讨论已经不只是“谁更强”,而是“什么任务该用哪种系统形态”。
更值得展开的信号来自 Agent 和产品入口。Karpathy 把 Claude 描述成组织内持久、异步、带工具和上下文的实体,Manus 在做 sources 自动推荐,Google AI Studio 的 Android app 生成量被拿出来当增长信号,OpenAI 则在 DevDay 上继续强化开发者入口。AI 正在从聊天框走向工作流、团队协作和应用生产。
研究侧没有爆炸新闻,但有几条硬信号:Stanford AI Lab 的 Spiral 关注 test-time scaffold 与训练目标的不一致,Ian Goodfellow 提到小型 open weight model 加 structured search 在漏洞发现上有竞争力,Chollet 再次提醒复杂性是未来每次修改都要缴的税。本期的共同底色是:模型能力继续涨,但真正的分水岭越来越像系统设计、上下文治理和工程取舍。
模型讨论从单点能力比较,转向成本、开源窗口、任务路由和前后端场景分工。
她认为 GPT 5.6 发布后 Fable 的意义会下降,核心判断是 5.6 更便宜、更快、更务实,同时批评 Anthropic 模型在“thinking”上消耗过多 token。
她介绍 RouteLLM:根据 prompt 自动路由到合适模型,在 Opus、GPT、Grok 等模型之间切换,并记住偏好,以实现成本与性能的权衡。
她称闭源 AI 处于暂停窗口,主张开源模型应趁机冲击排行榜,并提到将推进 Smaug-Agent 这类 trillion-parameter 模型。
她给出模型场景分工判断:Kimi 2.7 和 GLM 5.2 在前端 coding 上很强,GPT 5.5 仍更适合 backend,Opus 4.8 的前端优势下滑。
Chollet 判断 2040 年 AI 不会建立在今天这套 stack 上,当前系统存在数量级的数据和计算低效,近似最优 AI 将来自 symbolic learning。
AI 产品形态正在从单点聊天转向持久上下文、资料引用、开发者活动和应用生成入口。
Karpathy 将 Claude 的新交互范式称为 LLM UI/UX 的第三次重设计:从网站、桌面 app,走向组织内持久、异步、带工具和上下文的实体。
Manus 更新 sources 能力:不再要求用户精确寻找 URL,而是根据需求推荐相关网页,并在后续任务中持续引用这些资料。
Logan 提到过去一个月里,用户已经在 Google AI Studio 中直接创建超过 100 万个原生 Android app,用数量展示应用生成入口的扩张。
他进一步把应用生成能力转化为个人行动号召:你也可以构建自己的 native app,延续 Google AI Studio 的低门槛开发叙事。
OpenAI 宣布 DevDay 2026 开放申请,地点为 San Francisco,时间为 9 月 29 日,申请截止 7 月 10 日。
Microsoft Research Podcast 讨论把 AI 看作不只是自动化人类已有任务的工具,而是打开新可能性的方式。
从 test-time scaffold、漏洞搜索到代码复杂性,本期研究信号都指向“模型外系统”正在变得关键。
Stanford AI Lab 介绍 Spiral:既训练模型生成对 aggregator 集体有用的多样回答,也训练模型聚合这些回答,回应 test-time 多采样与训练目标不一致的问题。
Goodfellow 提到在 LLM 找漏洞方向,Aisle 早于 Mythos;工程上值得注意的是,小型 open weight model 加 structured search 也能在该任务上具备竞争力。
Chollet 强调软件复杂性是每次未来变更都要支付的税,优雅代码的价值不在审美,而在可维护性。
Zack 认为 cyber 并不神秘,组织应该采取必要步骤把基础工作做得更好,这条短评把安全问题重新拉回工程执行。
Emad 的两条帖把中国视频模型、Seedance、Grok imagine 和实时生成串成一条创作基础设施演进线。
几条非产品帖共同指向一个判断:地图、市场和安全倡议都会被集体叙事反向塑形。