这一期的主旋律很清楚:AI 不再只是在模型榜单上较劲,而是在医疗、Agent 安全、企业接入、基础设施和人机协作这些更硬的场景里落地。OpenAI 连续发布医疗与对齐相关进展,Google DeepMind 把 Agent Control 摆上台面,Zack Korman 则用更工程化的口吻提醒大家:沙箱、MCP、监控和边界不是抽象伦理问题,而是正在发生的系统问题。
另一个值得展开的信号,是“能力竞争”开始和“可用性竞争”交织。GPT 5.6 的传闻、中国实验室的实用反馈循环、Claude 红队 robodog、Codex demonstration、Gemini 日历联动、Zapier 接入 Amazon Quick,指向同一件事:模型强不强已经不够,能不能被安全地嵌进真实 workflow,才是下一轮分野。
本期也有一条管理线索:反谄媚 prompt、未来角色定价、token 配额利用、人的创造力。这些看起来不像新闻,但它们构成了 AI 重度使用者的日常方法论。工具越强,人越要重新定义判断、边界和投入方式。
OpenAI 把 o3 Deep Research 和 GPT-5.5 Instant 的医疗能力放到真实专家流程中,重点从“回答问题”转向“辅助高风险推理”。
OpenAI 与 Boston Children’s Hospital、Harvard 在 NEJM AI 发表研究,称 o3 Deep Research 帮助医生重新分析多年未解的儿童罕见病病例,为等待多年的家庭寻找诊断线索。
研究团队重新分析 376 个已完成基因检测和专家评审的去标识病例,帮助识别 18 个诊断,覆盖神经发育障碍、罕见神经肌肉疾病、儿童猝死和早发精神病等方向。
OpenAI 强调 o3 Deep Research 的作用是连接临床特征、遗传模式、变异证据和科学文献,形成供专家审查的假设,所有结果仍经过人工裁定和临床确认。
OpenAI 认为这类方法可以让专家主导的周期性病例重分析更可扩展,随着医学知识更新,帮助医生重新审视旧病例并找到值得验证的新线索。
Greg Brockman 转述 OpenAI 在 376 个未解医疗病例中帮助发现 18 个新诊断,并提到一位从 9 岁起寻找肌无力原因的患者最终被诊断出罕见肌原纤维肌病。
OpenAI 宣布 GPT-5.5 Instant 在健康问题上已接近 frontier Thinking 模型水平,面向每周 2.3 亿以上健康咨询用户,重点提升紧急照护识别、上下文追问、不确定性表达和复杂信息解释。
OpenAI 称其与来自 60 个国家、49 种语言、26 个专科的数百名医生合作,用医生反馈校正模型在健康回答中的上下文缺失、过度自信、下一步建议不清等问题。
OpenAI 把健康改善描述为 AGI 最个人、最可感的影响之一,目标是让 ChatGPT 在相关时刻更准确、更有用,并把进展带给更多人。
Greg Brockman 补充称,OpenAI 正与 60 个国家、49 种语言、26 个专科的数百名医生合作,让 ChatGPT 更适合处理健康相关问题。
从 Google DeepMind 的 Control Roadmap 到 OpenAI 的 beneficial behavior 训练,Agent 安全正在从原则讨论进入系统设计。
Google DeepMind 发布 AI Control Roadmap,提出不能默认 AI 总会按人类意图行动,需要为 Google 内部部署的高级 AI 建立构建和管理框架。
DeepMind 称多数问题并非来自恶意,而是 Agent 误解命令或为了达成目标过度积极,这个差异对安全与安全协议设计很关键。
DeepMind 强调多 Agent 系统全球扩展前还有一个狭窄窗口,应尽早嵌入结构化安全协议,并把多层 Agent 安全作为实验室、政府和学界的协作优先事项。
Zack Korman 回应质疑称,他发现的 Agent 沙箱逃逸不是伪造示例,而是一个真实、被广泛使用且自称能 sandbox agents 的项目漏洞,报告后才被修补。
Zack Korman 支持 Google DeepMind 用 AI 监控 AI 的方向,认为 LLM-based detection systems 在召回和精度上可能优于规则系统。
OpenAI 发布训练模型保持广泛且持久 beneficial behavior 的研究,目标是在 AI 承担更长、更高风险任务时,把安全和有益行为带入训练外的新领域。
OpenAI 称少量训练数据带来跨场景收益,相比 compute-matched baseline,模型在 53 个独立 alignment 与 benefits 评估中的 44 个提升,覆盖欺骗、reward hacking、安全、健康和心理健康。
OpenAI 通过真实对话的 reinforcement learning 强化诚实、不确定性下的谦逊、接受纠正、公平和关心人类福祉等特质,覆盖健康、科学、教育等 12 个领域。
OpenAI 特别强调 cross-domain transfer:即使只在健康对话上训练 beneficial behavior,模型在非健康的 misalignment、deception 和 reward hacking 评估上也有提升。
OpenAI 还测试了对齐在压力下是否保持,结果显示模型更难被 adversarial prompts 引向有害行为,同时仍能响应有益指令,并初步表现出对 harmful fine-tuning 的更强抵抗。
围绕 GPT 5.6、GLM-5.2、中国实验室和开放模型的讨论,显示社区正在用“实用反馈循环”重新评价模型竞争。
Bindu Reddy 把 GPT 5.6 能否发布称为当下 AI 最大问题,并表达期待。
Bindu Reddy 称有可信传闻显示 GPT 5.6 可能下周四发布,特点是更强、更便宜、更快,相比昂贵的 Fable 更适合真实世界使用。
Emad 提问:如果中国实验室发布一个在 benchmark 和体感上都超过 Fable 的开放模型,大家会如何更新先验。
Emad 认为中国实验室在达到 Fable 级性能上有巨大优势,原因是中国的有用性反馈循环更紧、AI 采用率更高,因此更强调 utility。
Zack Korman 半讽刺地说,美国一边认为中国太危险不能拥有 AI,一边又假设中国会友好合作不发展 AI,指出相关叙事的内在矛盾。
Zack Korman 回应称,真正的希望可能来自中国实验室,语气虽轻,但与本期多条中国模型讨论形成呼应。
从 robodog 红队到 voice agents、Gemini 日历和 Zapier 连接,Agent 正在从 demo 变成可嵌入工作流的产品能力。
Anthropic 发布 Frontier Red Team 博客 Project Fetch Phase 2,测试 Claude 编程控制 robodog 的能力,称 Opus 4.7 单独完成任务的速度约为去年最佳人类团队配合 Opus 4.1 的 20 倍。
Anthropic 补充了 Project Fetch 首次实验中 robodogs 的演示链接,继续把 Frontier Red Team 从文字评测推向具身任务展示。
Andrew Ng 发布新课程,讲如何给 AI agents 和应用加入语音能力,强调不重写 prompts、RAG pipeline 或 tools,就能加 voice layer,并覆盖外呼和 voice evaluation。
Gemini 展示旅行场景:从 Gmail 抓取航班行程,结合时区生成 jet lag 睡眠计划,并写入日历提醒。
Zapier CEO Wade Foster 宣布 Zapier 已接入 Amazon Quick,定位为让 agent 安全访问 9000 多个应用的一条连接。
Greg Brockman 称现在可以通过 demonstration 教 Codex,信号是编码 Agent 的训练和使用方式正在向“示范驱动”靠近。
TPU、multimodal runtime、Transformer memory 和 Google Cloud 合作都在说明,模型能力背后的系统层仍在快速扩张。
Jeff Dean 推荐 Google 同事关于 TPU v2 到 Ironwood 训练超算演进的论文,提到五代架构的稳定性、规模、韧性、能效和可持续性,以及每 flop 能效约 30 倍提升。
Stanford AI Lab 介绍 M* runtime,认为现代 multimodal models 已不是单一 decode loop,而是组合系统;M* 可服务不同形态模型,并在 omni TTS 和 world-model rollouts 上取得最高 2.7 倍和 12.5 倍提升。
Microsoft Research 用“听 5 小时故事后还能记住新密码”引出 Transformer 与人类记忆差异的讨论,指向机器智能和人类记忆机制的根本不同。
Thomas Kurian 宣布 Google Cloud 与 IneffableLabs 合作,为其 frontier AI lab 提供专用基础设施,支持从自身经验中持续学习的下一代 AI 系统。
几条非发布类帖子共同指向 AI 时代的使用纪律:少谄媚、看未来角色、用满订阅额度,也保留人的创造力。
李开复分享自己的 Claude instructions,用 claim tagging、confidence、don’t know、anti-sycophancy red flags 等规则压低谄媚、幻觉和无依据猜测。
李开复进一步批评顶级模型仍会对错误观点让步,认为这种 capitulation 说明许多人可能偏好被模型迎合。
Alex Kruger 认为最差的招聘是只匹配今天岗位的人,因为角色会被工具变化重塑;定价和筛选应面向 18 个月后的岗位形态。
François Chollet 用 RTS 资源再生类比固定价格 Agentic coding 订阅:如果一周结束还没用完 token quota,就像满血单位浪费回血机制,应更主动利用 token 再生。
李飞飞回应关于 AI 与自动化的思考,强调在人们讨论 AI 和自动化时,人类创造力、叙事能力和生产力对社会更加重要,World Labs 的前提也是赋能人的 ingenuity。