这一期的主旋律不是单点模型发布,而是 AI 正在进入可运营、可编排、可治理的阶段。关注列表里最强的信号来自 Agent 工程化:有人把 Codex 放进持续维护仓库的循环,有人讨论代码风格如何服务更弱的模型理解,也有人把 MCP、自动化动作和安全部署拉到真实生产环境里。
另一条线是 Google 系产品和研究同时铺开。DiffusionGemma、Gemini Notebooks、Omni Flash、TacticAI、AI 集体行为研究基金,分别对应模型速度、知识空间、视频生成、空间决策和多 Agent 群体行为。它们不是同一个产品故事,但共同指向一个趋势:AI 能力开始从聊天框扩散到工作空间、体育场、研究流程和组织培训。
值得警惕的是安全叙事也在变。社区讨论已经不只盯 prompt injection 或 MCP server 风险,而是转向谁控制 Agent、谁定义安全边界、企业如何在自动化扩张前保住责任链。今天的报纸更像一张系统化转折的切片:能力继续外溢,治理债务也同步上升。
Agent 不再只是演示能力,开始被放进仓库维护、代码理解、MCP 动作和生产部署的日常链路。
分享一个用 Codex 维护仓库的循环:每 5 分钟唤醒一次,把工作分派到多个线程,再用 orchestrator、triage、autoreview 和 computer use skills 组合推进,让部分工作可以自主落地。
提出一个很工程化的判断:LLM 也许能探索更适合模型理解的代码结构,让较弱模型也能在代码库里完成任务;为理解而优化的代码风格,对人类和前沿模型都可能有帮助。
欢迎 ona_hq 加入 OpenAI 团队,目标是帮助组织把 agents 安全地部署到生产环境。这是 Agent 从 demo 走向企业运行时的明确信号。
用 NoPlex 案例说明 Zapier MCP 的价值:当 Claude 原生 Google Drive MCP 不能追加 Google Sheet 行时,Zapier 提供了更完整的动作层,把每周 4 小时媒体筛选压缩到 15 分钟。
Gemini、Gemma 和 Google Research 相关更新覆盖模型速度、知识工作区、视频能力和产品体验。
称赞 DiffusionGemma 的 text diffusion 创新,强调它速度很快,比其他 Gemma 4 models 快 4 倍,并期待开发者基于它构建新东西。
Gemini Notebooks 开放到欧洲经济区、英国和瑞士。Notebooks 被描述为能记住来源、指令和对话的专注项目空间。
称 Gemini Omni Flash 在 image to video、text to video 和视频编辑上达到 SOTA,并表示很期待把能力开放到开发者 API。
预告 Discord 社区活动,介绍 Gemini 的 Neural Expressive 设计语言,包括动态视觉响应和无缝模式切换等体验更新。
研究关注点开始从单模型性能扩展到群体行为、自我改进、科学发现和可信协作结构。
宣布与 Schmidt Sciences、coop_ai、ARIA Research 等合作推出 1000 万美元研究基金,研究数百万 AI agents 互动时可能涌现的集体行为。
发布 Recursive 的早期结果,称开放式知识发现系统在 NanoChat 5min pre-training 和 NanoGPT SpeedRun 上取得新的社区最好表现。
分享与 Google Research 负责人 Yossi Matias 的对话,主题是 AI 如何加速科学进步的循环,并改善真实世界里的生活。
介绍 Encrypted Spaces 研究:面向协作应用的架构,让数据保持加密,同时让操作具备可密码学验证性。
AI 的应用叙事从通用助手延伸到足球战术、空间决策、基础设施劳动力和公益组织。
宣布与 Palmeiras 合作,把 TacticAI 用于足球开放比赛场景,模拟场上态势并预测最多 8 秒后的开放比赛动态。
解释 TacticAI 的机制:用 graph neural networks 把 22 名球员建模成节点及其物理互动,让俱乐部数据科学团队能实时拖拽球员测试防守设置。
强调足球场景的外溢价值:实时比赛包含 partial observability 和 multimodal data,连续空间问题的解法可能迁移到机器人、游戏等领域。
宣布 Google.org 追加投入,帮助 30 万美国工人为电工、管道工、焊工、制造业等高需求技能岗位做准备,把数字经济与实体基础设施连接起来。
社区讨论的安全焦点从单点攻击扩展到平台控制权、自动化表面风险和企业安全预算。
用反讽方式指出,大家一直担心 prompt injection 和受损 MCP servers,但最大的 AI agent 安全风险可能是平台方控制你的 agent。
建议先放下对 Anthropic 和 Mythos 的立场,把 Dario 的文章拿给老板看,争取把网络安全预算翻倍。这更像是社区对 AI 安全预算窗口的判断。
谈 OpenClaw hardening:为了降低 surface risk,过去部分媒体转换需要 shell out 到 ffmpeg,下一版可通过 wasm 完成,并且性能对其场景相近。
评价 Claude Fable 模式有很强的 bias for action,会主动探索各种路径把任务完成。作者认为这让 agent 更强,也带来一点令人不安的边界感。
AI 能力扩散正在通过 fellowship、候选人训练营和产品社区活动进入组织与劳动力市场。
推出 Claude Corps 全国 fellowship,面向职业早期人才匹配美国非营利组织,计划教授 1000 人使用 Claude,并支付他们用 AI 支持组织使命。
复盘 Scale Army 第一次候选人 webinar:用 AI 教销售运营全流程,包括找线索、补充信息、写 outbound、让 agents 处理回复和预约会议,验证了快速补齐 AI 工作能力的培训假设。
宣布 6 月有 3 场 webinar,主题包括 Manus x Similarweb、Manus 101,以及构建网站和移动应用。信号不大,但说明 agent 产品仍在通过教育活动扩散。