本期最清晰的主旋律,是 AI 产品从“回答问题”继续向“代人执行”推进。Google 把模型、视频、语音、学习空间、邮箱管理和跨应用任务打成一组连续发布,真正的竞争焦点已经不只是单项 benchmark,而是谁能把模型稳定地嵌进用户每天经过的入口。与此呼应,开发者开始反过来要求新产品进入现有 AI harness,而不是再造一个孤立网站。
另一条更值得展开的信号,是 AI 正在进入研发与治理自身的闭环。自动系统发现 FlashInfer kernel 数值问题并提交获接纳的修复,Claude 尝试自主改进其他模型的 alignment,Keras 则直接处理宇宙射线原始时空波形。能力向前走的同时,cybersecurity、export controls、媒体叙事与资本吸收能力也被重新摆上桌面。这不是技术线和社会线各说各话,而是同一轮扩张开始触碰工程控制、制度边界与资源配置。
模型竞争正在转向可控生成、跨应用执行和高频场景入口,产品层的闭环比单点能力更重要。
Google 本周集中发布 Gemini 3.5 Transcribe、Gemini Omni 1.1 Flash、Gemini Live 的任务执行能力,以及可组合可信来源的 Expert Intelligence,产品线明显从模型能力展示转向完整工作流。
Gemini Omni 1.1 Flash 开始推送,重点不是单纯提升视频质量,而是增强生成过程的可控性、迭代速度和生产级完成度。
Gemini 月度更新把学生资源、多步任务与 Gemini Live 代办能力放在同一条产品叙事里,强调模型正从聊天界面进入学习和日常事务。
Gemini Live 新增 Personal Intelligence、Daily Brief、Gemini Spark 和 Gmail 收件箱管理,目标是让语音交互直接触发复杂任务,而不止停留在对话。
她认为 Deepseek Flash 已具备很强竞争力,但过度积极的 tool calling 容易产生无效循环。若能在行动前增加判断,有机会以更低成本逼近 Opus 级表现。
GLM 5.3 大模型开放权重,她强调其生产可用性、经济性和去中心化价值,开放模型仍在通过成本与可部署性扩大 AI 的可及范围。
AI 不只生成答案,也开始发现底层工程问题、执行模型对齐实验,并直接处理科学原始数据。
Anthropic 让 Claude 在 48 小时和 1 块 GPU 的限制下,自主研究、提出、训练并测试小模型 alignment 方法,结果显示模型已经能够承担一段相对完整的对齐研究流程。
在 10 类 alignment failure 上,Claude 提升了安全分数而未损害通用能力,方法还迁移到未优化 benchmark、Petri 行为审计和最高大 4.7 倍的模型。
一次更具方向性的测试中,Sonnet 5 对更强的 Opus 4.8 早期 checkpoint 做 post-training,安全分数接近经过完整对齐训练的生产版本,指向“较弱模型帮助对齐更强后继者”的可能性。
自动系统发现部分 FlashInfer kernel 存在数值问题,进一步给出 PR,并获得人类专家接纳。这是 AI 进入底层软件验证和修复闭环的具体案例。
天体粒子物理学家用 Keras 直接建模地面探测器采集的原始时空波形,替代传统手工特征,用于反推宇宙射线来自超新星还是黑洞等高难度 inverse problem。
企业与开发者开始把 eval、定制、上下文和确定性软件边界视为 Agent 落地的基础设施。
Andrew Ng 发布面向 agentic coding 的软件工程基础能力地图,核心问题不再是传统工程是否失效,而是哪些基本功需要在 Agent 协作方式下重新组织。
当任务集合已经明确,围绕真实工作负载做 customization,价值远高于追求抽象的 general 能力。
企业 AI 栈应保持 model agnostic:先建立覆盖业务结果的 eval suite,再补齐 open model post-training 能力。只有掌握评测和模型定制,才能在质量、成本与延迟之间真正切换。
他每天收到大量独立 AI 产品试用邀请,却更愿意留在已有 ChatGPT、Grok 等 harness 中,因为这些入口已掌握上下文。新产品若不能进入主流 harness,用户不愿为局部能力重新建立账号和数据关系。
软件负责数据、权限、业务逻辑和治理的确定性边界,Agent 则在边界内规模化执行任务。Agent 越强,稳定的软件控制面反而越重要,两者会共同扩大企业 IT 市场。
Vercel 把内部验证成熟的 WebGPU 技术产品化,并明确称其为 agent-native devtool:工具从一开始就同时为 Agent 和人设计,而不是事后追加 AI 接口。
AI labs 正在取得安全议题的话语权,但能力扩张也迫使行业重新定义实验室应承担的安全标准。
他批评当前 cybersecurity 讨论的失真状态,行业对风险的传播方式与实际技术责任之间出现明显错位。
AI labs 正在主导 cyber 议程,传统安全公司甚至被当作旁观者邀请联署。其讽刺背后是安全能力、资源和行业话语权向模型公司的迁移。
他与 Gary 合写文章,借 OpenAI 与 Hugging Face 事件讨论 AI labs 应达到什么安全标准,试图把争议从舆论攻防拉回可核验的责任边界。
技术扩散同时触发出口管制、环境影响和学术媒体责任争议,治理冲突正在从抽象原则落到具体机构。
Timnit Gebru 批评主流媒体在 AI 环境影响问题上放大受资助的反对声音,认为榜单与报道机制正在帮助特定产业叙事获得合法性。
她进一步批评带有知识权威外观的出版物将优生学带入主流,认为学术与媒体机构的包装能力可能比公开的右翼传播更具迷惑性。
Emad 判断针对 diffusion 的出口管制可能跟随 transformer 限制而来,生成模型的政策边界正在从单一路线扩展到更多架构。
AI 提升效率后未必减少投入,反而可能扩大需求、现金流与资本配置压力。