这一期的主旋律很清楚:AI 正在从模型竞赛进入工作现场。OpenAI 把 GPT-5.4 放进药物化学实验循环,Google DeepMind 把 AI 放进住房审批流程,Gemini 把实时对话、视觉理解和图像生成塞进消费级产品。值得看的不是单点能力,而是模型开始接管更长的任务链:读文献、提假设、设计实验、解释数据、生成内容、连接工具。
另一条线更锋利:GLM-5.2 和开源模型被多位关注人集中讨论。它一边在 agent sandbox escape、网页生成和 benchmark 上制造惊喜,另一边引出中国 AI 栈、开源权重、成本结构和闭源公司叙事权的争论。今天的信号不是“谁赢了”,而是 frontier 体验开始被更低成本、更开放的系统逼近。
还有一层更底层的提醒:软件工程、招聘、研究范式和 agent 编排都在被重新定义。真正重要的问题不再只是模型强不强,而是人、组织和评估体系如何重新分工。
模型不再只是聊天或生成内容,而是在药物化学、生命科学评测和政务审批中承担更长链条的工作。
OpenAI 称 GPT-5.4 与 Maria AI 及专业实验室配合,推动一个药物化学项目从文献回顾走到已验证实验结果,模型提出了改进常用反应的意外路径。
Maria 对 10,080 个反应进行了测试,人类化学家手工验证代表性结果;优化条件下,多数 boronic acids 和 sulfonamides 的产率提升。
OpenAI 发布 LifeSciBench,用 173 位生物技术和药物研究科学家编写的 750 个任务,评估 AI 对真实生命科学研究流程的支持能力。
Google DeepMind 与英国政府相关部门合作开发 AI 住房规划申请原型,目标是减少重复劳动,让规划人员把注意力放到复杂项目上,并可能将处理时间缩短最多 50%。
Greg Brockman 转述 AI 帮助破解健康谜题的案例,把它作为对 AI 保持兴奋的现实动机。
多位关注人把 GLM-5.2、国产算力栈和 open weight 模型放在同一天讨论,信号集中指向开源与中国 AI 体系的逼近速度。
Zack Korman 初步测试认为 GLM-5.2 很擅长发现 agent sandbox escape 和权限绕过问题。
他进一步表示 GLM-5.2 几乎一次性打穿自己的 agent sandbox escape workshop,对其越狱能力评价极高。
Emad 强调 Z.ai 使用 Huawei Ascend 芯片训练而非 NVIDIA,称这是成本低约 90% 的完整中国 AI 栈,并估算总成本约 2500 万美元。
Emad 判断,如果中国 AI 实验室能获得足够算力,它们超过美国实验室的趋势会越来越清晰。
Bindu Reddy 认为 GLM-5.2 在 benchmark 上非常强,部分指标超过 Opus 4.8 和 GPT 5.5,但也提醒它可能针对 benchmark 做了强化,内部评测仍需谨慎看待。
Bindu Reddy 预告 Abacus AI 的开源 Dragon 模型,称开源已接近闭源能力,并在打造适合小型 agentic loops 和大规模并行任务的 Smaug-Flash。
软件工程的变化速度、代码生成能力和 agent 编排方式成为共同话题,指向开发流程本身的重构。
Greg Brockman 感叹软件工程已经变得完全不同,甚至很难回忆 6 个月前的开发状态。
Zack Korman 让 GLM-5.2 根据几页营销材料和三句话 prompt 为创业公司生成网站,展示模型从粗输入直接产出前端页面的能力。
Stanford AI Lab 推荐 DeLM 相关报道,主题是如何在没有中央 orchestrator 的情况下编排 agents。
Berkeley AI Research 转发长周期编程研究,问题是 AI coding agents 和顶尖程序员在 long horizon 任务上谁更能 scale。
从 GPT-Realtime-2 到 Gemini Live,实时对话、视觉输入、工具调用和图像生成正在被打包成更自然的用户入口。
Greg Brockman 称 GPT-Realtime-2 是一个新东西,释放出 OpenAI 在实时交互方向继续推进的信号。
Gemini 推出 Nano Banana 2 模板,用户可以把自拍转换成球队主题的 trading cards、murals、cartoons 等视觉内容。
Gemini 介绍 Gemini Live 社区演示,重点是持续对话、中途连接工具、让 Gemini 看见用户所见内容,并无缝生成新图像。
同一天里既有模型劝服力风险,也有 Anthropic、开源模型和政府态度的争论,AI 安全叙事正在和产业竞争叙事正面碰撞。
Emad 转发 AI Safety Institute 与 Oxford 相关研究,称 frontier AI 已能在对话中说服专家级人类,包含世界观相关议题。
Zack Korman 认为解除 Fable/Mythos 禁令几乎不会改善 cybersecurity,因此不在意政府是否采取这一动作。
Bindu Reddy 批评 Anthropic 员工抱怨政府攻击,认为他们一边宣称技术可能毁灭人类,一边又继续构建该技术,叙事上自相矛盾。
Zack Korman 把中国开源权重模型描述为五分之一价格的 OpenAI Opus 级供给,并反驳把这种开放视为坏事的叙事。
几条非产品帖共同指向同一件事:真正的能力来自问题重构、深度追问和经得起时间检验的基础结构。
Alex Kruger 反对模板化面试题,主张围绕候选人最自豪的一个项目连续追问二十层,直到看见真实能力或很快耗尽细节。
François Chollet 提醒,最难的问题通常不是靠给方案增加复杂度解决,而是通过重构问题,让更简单清晰的答案显现。
Microsoft Research 纪念 ResNet 获 CVPR 2026 Longuet-Higgins Prize,强调 residual connections 十年后仍是现代 AI 系统的基础,引用超过 320,000 次。
Yann LeCun 转发 JEPA 解释视频,借 30 多年研究脉络回看这一表示学习方向,属于基础概念再解释的信号。