今天的主旋律不是“又出了一个模型”,而是 AI 系统开始露出工程化骨架。Claude Code 的后台 subagent、Andrew Ng 讲 loop engineering、Microsoft Research 把 skill 编辑训练化,连 Codex 的额度与权限复盘都在说明同一件事:Agent 的能力正在从 prompt 灵感,转成运行时、权限、成本、评测和闭环治理。
另一个明显信号来自 Google 的多模态发布。Nano Banana 2 Lite 和 Gemini Omni Flash 没有只讲炫技,而是把速度、价格和“图像生成后立刻视频化”的工作流摆在台前。NotebookLM 的短视频概览则把知识消费推向移动端短内容,这背后是表达介质的变化,不只是模型能力的变化。
产业层面更值得展开的是控制权问题。open-weight 模型接近前沿后,价值可能重新流向云、算力、企业安全和领域微调;而 GeneBench-Pro、AutomationBench、Bridgewater 的金融新闻模型都在提醒我们,下一阶段真正稀缺的不是单次回答,而是在真实业务噪音里选对路径、完成闭环、可被托付。
本期最强信号不是单个模型,而是 agent 从一次性对话走向可编排、可训练、可长期运行的工程闭环。
Boris Cherny 透露 Claude Code 下一版会让 subagents 默认在后台运行,用户可以继续与 Claude 对话。这说明 coding agent 的交互重心正在从“等它做完”转向“并行编排”。
Andrew Ng 系统化解释 loop engineering:agentic coding loop、developer feedback loop 和 product discovery loop 共同支撑 0 到 1 产品构建。重点是让 coding agent 能长时间自测、自修、自迭代。
Microsoft Research 推出 SkillOpt,把 agent 的 skill 编辑变成训练过程,在不改模型权重的情况下提升行为可靠性。这是 SkillOps 从经验手改走向可优化流程的信号。
AI 编程工具开始补上成本、权限、社区协作这些“产品运行时”能力,热闹背后是托付成本的上升。
Thibault Sottiaux 公开复盘 Codex 额度异常:auto-review 更主动、subagent 工作量增加、后台建议重复或重试过频共同放大了消耗。Codex 已修复调度和统计口径,并重置额度。
Codex 面向高级用户推出 permission profiles,用可复用、可继承的文件和网络权限规则替代粗粒度 sandbox,并支持 fail-closed 管理白名单。coding agent 的安全边界开始任务级细化。
Peter Steinberger 回应 OpenClaw 争议:OpenClaw 是 OpenClaw Foundation 下的独立开源项目,不是 OpenAI 产品。移动端安全配对、推送和 App Review 都有真实工程成本,社区注意力更应该投向建设者。
Google 的多条发布把竞争焦点落到低延迟、低成本,以及图像到视频的连续创作链路。
Logan Kilpatrick 发布 Nano Banana 2 Lite 和 Gemini Omni Flash:前者主打 4 秒内出图和低成本,后者主打视频编辑,并进入 Gemini API 与 AI Studio。
Google AI 将 Nano Banana 2 Lite 与 Omni Flash 包装成“先快速生成图像,再立即动画化”的创意工作流,并计划接入 NotebookLM、Flow、Gemini、Stitch、Search 和 Photos。
NotebookLM 推出 Short Video Overviews,可把复杂资料转成 60 秒竖屏解释视频。知识产品正在吸收短视频表达,把“读资料”变成可快速消费的移动端内容。
几条信号共同指向一个变化:模型强弱不再只看榜单,而要看它能否在混乱、多步骤、带判断的任务里完成闭环。
OpenAI 发布 GeneBench-Pro,用于评估 agent 在复杂生物数据中选择分析路径、做科研判断的能力。它关注的是接近真实计算研究的“会不会走对路”。
Wade Foster 称 Claude Sonnet 5 在 Zapier AutomationBench 上显著超过 Sonnet 4.6,适合日常多步骤自动化;但高风险任务仍应选择更有克制力的 Opus。
Stanford AI Lab 介绍 R&B-EnCoRe,让 Vision-Language-Action 模型自学哪些 chain-of-thought 真正有助于行动,不依赖奖励、验证器或人工标注。
开源模型、闭源前沿、云平台和能效工程被放在同一张产业账本上,控制权不只在模型参数里。
Aaron Levie 把 AI 产业控制权拆成两种假设:如果闭源前沿长期大幅领先,垂直整合和访问控制可持续;如果 open-weight 长期贴近前沿,大量 token 会流向替代栈。
Madhu Guru 认为 GLM 等强 open-weight 模型反而会增强 Google Cloud 这类基础设施方的位置,因为企业会需要托管、微调、安全和支持能力。
Karpathy 关注低电压域、集群级内存等 tokens/watt 工程细节,指出交互式 LLM 的竞争越来越接近芯片、电力和系统工程,而不只是模型规模。
企业侧信号更务实:云平台负责分发和治理,领域模型负责把成本和效果打到具体业务场景里。
Claude 宣布在 Microsoft Foundry 上 GA,Azure 客户可使用 Claude Opus 4.8 和 Haiku 4.5,并通过 Azure 认证、计费和承诺消费抵扣使用。
Soumith Chintala 提到 Bridgewater 用 Tinker 微调金融新闻模型,效果更好、成本更低。这条路线说明企业 AI 不一定永远买最大模型,而是沉淀领域判断标准。
Thomas Kurian 宣布 Google Cloud 与 FactSet 合作,把 agentic AI 和 Gemini 带给金融从业者,用于自动化复杂工作流和更快提取关键洞察。