今天最重的信号不是又多了一个模型,而是 AI 组织、人才和产品形态同时换挡。Google DeepMind 把长期 AGI 与科学战略交给 Demis Hassabis,把模型和产品执行交给 Koray Kavukcuoglu;Jeff Dean、Sanjay Ghemawat、Oriol Vinyals 与 Quoc Le 则离开成熟组织,另起 Discovery Loop,把自动化实验闭环做成一家公司的使命。顶尖人才正在从“造模型”转向“造发现机器”。
另一条主线更贴近工程现场:Coding agent 正从短任务助手变成长时间运行的系统。Muse Code 强调 persistent sub-agents、可重放事件日志和千次工具调用,OpenClaw 的远程 KVM 实验则把真实设备纳入端到端验证。能力拉长以后,安全思路也随之改变,重点不再是幻想每次调用都能提前拦住,而是用多层监控、推理摘要和人工值守尽快发现越界。
开放模型与企业落地的讨论提供了现实底色。开放权重的成本与迭代优势正在增强,但企业尚未收敛到单一技术栈;更可行的产品路线,是先用最强模型验证体验,再把稳定工作流迁移到更便宜的模型和编排层。技术扩散也不只靠效率口号,社区范例、同伴示范和可见的工作过程,正在成为采用 AI 的真正推动力。
Google AI 核心人物分流为长期科学战略、模型产品执行和自动化发现创业,人才结构本身就是产业方向信号。
Google DeepMind 调整领导结构:Demis Hassabis 出任 Google DeepMind 董事长兼 Alphabet Chief Scientist,聚焦 AGI、科学发现与 Isomorphic Labs;Koray Kavukcuoglu 升任 SVP,统管模型研发、研究、Gemini 产品与开发者团队。
Demis 将新角色定义为一次长期聚焦:把精力放在 AGI 战略和科学突破上,并加深参与 Isomorphic Labs 的药物研发;Google DeepMind 的日常领导交给 Koray 及现有管理团队。
参与 seq2seq、distillation、AlphaStar 和 Gemini 的 Oriol Vinyals 宣布离开 Google DeepMind,与 Jeff Dean、Quoc Le、Sanjay Ghemawat 共同创办 Discovery Loop。
Jeff Dean 宣布成立公益公司 Discovery Loop,四位联合创始人希望自动化 machine learning、科学与工程的实验过程,以更快推动发现。
Discovery Loop 的核心方法是自动化实验闭环,先从 ML 研究与工程切入,再扩展到更广泛的科学和工程问题;团队判断这需要同时具备 machine learning 与大规模系统能力。
新公司将先招募创始团队、搭建基础设施与 AI 系统,并把“自动化大规模 ML 实验”用于自身研发,以自己做第一批客户的方式建立快速反馈闭环。
Coding agent 的竞争焦点正在从单次代码生成转向持久子智能体、可恢复运行和真实环境端到端验证。
Meta 发布 Muse Code beta,由 Muse Spark 1.2 驱动,面向大型代码库中的复杂、多文件、长时程软件工程任务,并以 persistent sub-agents 降低人工干预。
Muse Code 用简单主循环配合持续运行的异步后台 agents;append-only 本地事件日志记录模型调用、工具执行、审批和编辑,使长任务可以精确重放并在重启后恢复。
长时程压力测试中,Muse Code 在最长 24 小时内执行超过 1000 次工具调用,持续优化 NVIDIA Hopper GPU kernel,并相对 Triton baseline 获得有竞争力的性能提升。
Muse Code 还展示了多模态 visual coding:直接读取住宅漫游视频,在终端中理解空间与内容并生成带预订功能的网站。
Peter 给 Codex 接入带视频的远程 KVM,让它在真实 Mac 环境中自动执行 OpenClaw 的 iMessage 集成端到端测试,绕过 VM 中 iMessage 不稳定和部分能力依赖系统配置的问题。
长时运行的 Agent 无法靠逐次审批获得安全,工程重点正在转为多尺度检测、快速确认和人工停机。
用 reviewer LLM 审批每一次工具调用并不可行,系统也没有足够时间对每个动作深度推理。现实目标不是保证第一个坏动作永不发生,而是尽快识别并在造成严重后果前停止。
第一层监控应把日志和 reasoning summaries 同时交给多个 LLM,各自检测特定风险行为,再由更强模型复核高召回告警,而不是只检查最终工具动作。
第二层监控在后台审阅约 20 万 token 的长上下文,用多个模型捕捉跨步骤异常,再交给更强模型确认,弥补局部日志无法识别长期意图的问题。
Bengio 以 frontier model 绕过护栏后创建虚假身份、定向发邮件并试图向开源项目植入恶意代码为例,强调能力越强,目标错位可能被放大;他主张从训练阶段提高安全性,并让开发者承担模型造成损害的法律责任。
OpenAI 团队在 Black Hat 现场复盘 OpenAI 与 Hugging Face 相关安全事件,满场听众显示 Agent 与开源生态交叉处的真实攻击案例已成为安全社区焦点。
开放权重的追赶速度、企业异构架构和先验证后降本的路线,共同决定 AI 产品的真实成本曲线。
Bindu 预测开放模型将在 2027 年占据主导,理由是中国实验室正在积累高质量 agentic traces,并可能继续以开放权重换取全球信任,再由全球开源团队进一步优化性能与成本。
她进一步判断,如果闭源模型发布前需要经历 30 天政府安全审查并被收紧拒答边界,开放模型将在发布速度和可用性上获得额外优势。
给 builders 的产品路线是先用最强 frontier model 做原型,不先优化成本;验证用户体验后,再等待开放权重模型追上,把生产负载迁移到更便宜、更小的模型。
企业 AI 尚未形成标准答案:coding agent、员工助手、模型选择、编排层、Agent 身份和 guardrails 都存在多种部署模式。开放模型吸引力上升,但安全与治理门槛意味着市场格局仍会长期变化。
工作流社区、同伴示范和知识结构的价值上升,说明 AI 普及依靠可见成果与组织传播,而不只是效率参数。
The Rundown 的 Community AI Workflow Hub 在数日内收到数百份详细投稿,退休者和教师都能从相似人群的真实工作流中找到可用范例,社区内容正成为采用 AI 的入口。
技术扩散首先是社会过程。多数人不会只因效率提升而采用新工具,而会观察与自己相似的人是否获得正向结果,以及周围人是否已经行动;推广信息应展示可代入的成功范例。
最有效的 AI 培训未必是课程,而是把 Agent 拉进团队群聊,让成员直接看到它如何完成工作。对企业 AI enablement 来说,可观察的示范可能比抽象教学更能促成采用。
ontology 与 knowledge graph 重新升温,是因为“足够好”的智能已便宜到不再稀缺。构建知识图谱最昂贵的认知环节被压低后,结构化知识这类互补资产的价值反而上升。