本期的主旋律很清楚:AI 竞争继续从模型能力外溢到基础设施、组织形态和工程方法。OpenAI 一天内同时放出自研 AI chip Jalapeño 和 GPT-5.5 Instant 更新,信号不是单点产品迭代,而是模型公司继续把产品、模型、推理基础设施和 agentic products 串成完整平台。
另一条线更值得展开:Agent 不再只是聊天框里的功能,而是在被重新定义为组织级 harness、代理经济和自动协作结构。Google DeepMind 谈 agentic economy,Karpathy 强调 org-level harness,Bindu Reddy 继续押注 recursive self-improving agents。热闹背后也有冷水:Carmack 复盘 Quake 的过度雄心和团队过载,Chollet 提醒复杂系统要从失败模式理解,Bindu 警惕软件工程退化成整天对 AI 说话。今天不是高密度新闻日,但几条线索合在一起,像是在提醒同一件事:AI 的下一阶段不只是谁的模型更强,而是谁能把算力、组织、评测和工程纪律管理起来。
OpenAI 自研 AI chip,把模型公司竞争继续推向全栈平台和推理成本控制。
OpenAI 宣布首款自研 AI chip Jalapeño,由 OpenAI 从零设计并与 Broadcom 推向生产,面向 ChatGPT、Codex、API 和未来 agentic products 的 LLM workload。核心信号是 OpenAI 正把平台边界从产品和模型继续下沉到基础设施。
Greg Brockman 补充 Jalapeño 是 9 个月内从零为 LLM inference 设计,并由 OpenAI 模型加速研发,强调 perf per watt 表现。重点不只是发芯片,而是推理效率开始进入模型公司核心叙事。
官方更新强调更懂意图、更会对话,社区同时继续押注下一波模型发布。
OpenAI 发布新版 GPT-5.5 Instant,称其更能理解问题背后的 intent,并能更可靠地处理复杂约束,在购物和本地推荐上也更连贯。更新先向付费用户推出,再扩展到免费用户。
Greg Brockman 用更口语的方式概括 GPT-5.5 Instant 改进:更有趣、更值得试用。官方叙事从纯能力指标转向交互体验,说明高频模型的可用性正在被重新包装为核心竞争点。
Bindu Reddy 连续提到 GPT 5.6 和 Claude Fable 5 可能很快回到发布节奏。这类内容更像社区预期和传闻温度,不宜当作事实,但能反映模型周期又开始被市场关注。
Agent 话题从单个 bot 转向组织级 harness、代理经济和多模型自改进结构。
Google DeepMind 的播客讨论 agentic economy:当大量 AI agents 开始谈判、交易和委托,系统会遇到安全陷阱、认知单一化和分布式智能等问题。关注点已经从单个 agent 能做什么,转向 agent 之间如何形成经济和治理结构。
Karpathy 反驳把某个新东西理解成 Slack bot 或 Claw 的看法,强调它不是一个 feature,而是 org-level harness。这个判断很关键:真正有价值的 agentic 系统可能不是功能入口,而是组织运行层。
Bindu Reddy 预告 recursive self-improving agents,并表示不会依赖 Anthropic 的高成本模型,而会采用 multi-LLM open source ensemble。这里的看点是 agent 产品开始把成本结构、多模型编排和自改进能力放在同一个叙事里。
医学、test-time compute 和 ARC-AGI-2 共同显示研究侧正在围绕真实瓶颈重排。
Microsoft Research 介绍开源系统 Talos,用来缓解基因医学中的人工 review 瓶颈:恢复 90% 的范围内诊断,同时每位患者只给专家呈现 1.3 个候选变异。AI 的价值不在替代专家,而在把专家注意力压缩到更小候选集。
Stanford AI Lab 提出 Spiral:既然测试时会用更长链路、并行采样和聚合来扩展 LLM compute,训练时也应教模型生成对聚合器集体有用的回答,并学会把这些回答聚合成更优答案。
Chollet 提到某个 open-source model 在 ARC-AGI-2 上取得迄今最强表现。信息很短,但在他长期关注泛化评测的语境里,说明开源模型能力正在进入更难的评测坐标系。
几条反思共同指向同一问题:AI 时代工程能力不是少做思考,而是更需要识别边界、失败和组织负载。
Carmack 复盘 Quake 早期错误:技术目标过于雄心、不断抽走设计师脚下的稳定基础、把团队长期压在 startup intensity 下,以及股权机制带来错误激励。这是一篇罕见的工程组织自省,重点不是怀旧,而是承认速度、复杂度和组织承载力之间有硬边界。
Chollet 说理解复杂系统的最好方式,是看 edge cases 和 failure modes,因为它们定义了系统轮廓。这句话和今天的 agent、LLM、组织系统话题放在一起看,很像一个方法论提醒:不要只看 demo,要看边界。
Bindu Reddy 警惕软件工程快速退化成一天到晚和 AI 模型说话,并预判以后连说话都可能由 AI 自己提示自己。她的表达偏情绪化,但击中了一个真实问题:AI coding 提效后,人的工程判断是否会被外包掉。
Carmack 和 Chollet 从历史与复杂系统两侧提醒:趋势不是命运,复杂性也常来自简单规则的可扩展组合。
Carmack 借 Jerry Pournelle 的科幻作品谈 70 年代美国的悲观背景:社会动荡、越战、水门、经济衰退、能源危机和 Apollo 退场都曾让人觉得未来不可修复。但后来的技术部门兴起和 SpaceX 式反转说明,坏趋势不是命运。
Carmack 继续补充自己与 Pournelle 的交集,并感叹单一商业公司最终发射的入轨载荷会超过全球政府总和五倍以上,这在硬科幻里都曾显得离谱。技术现实有时会反过来追上想象。
Chollet 说最复杂的现象往往来自简单规则的可扩展重组,从星系、芯片到神经网络皆然。找到正确 primitive building blocks 后,复杂性会自己生长出来。