Challen · X Following Dispatch No. 20260618

THE FOLLOWING

关注列表·北京时间24小时声音
2026-06-18 ★ 26 条 · 6 个主题 · 52 个账号 ★ COBALT GRID
编辑导言 FROM THE EDITOR

这一期的主旋律很清楚:AI 正在从模型竞赛进入工作现场。OpenAI 把 GPT-5.4 放进药物化学实验循环,Google DeepMind 把 AI 放进住房审批流程,Gemini 把实时对话、视觉理解和图像生成塞进消费级产品。值得看的不是单点能力,而是模型开始接管更长的任务链:读文献、提假设、设计实验、解释数据、生成内容、连接工具。

另一条线更锋利:GLM-5.2 和开源模型被多位关注人集中讨论。它一边在 agent sandbox escape、网页生成和 benchmark 上制造惊喜,另一边引出中国 AI 栈、开源权重、成本结构和闭源公司叙事权的争论。今天的信号不是“谁赢了”,而是 frontier 体验开始被更低成本、更开放的系统逼近。

还有一层更底层的提醒:软件工程、招聘、研究范式和 agent 编排都在被重新定义。真正重要的问题不再只是模型强不强,而是人、组织和评估体系如何重新分工。

覆盖 52/52 个关注账号 · 26 条入选 · 聚为 6 个主题 · 由 AI 实时归纳,仅供参考
§ 第 Ⅰ 章 §
◆

AI 进入科研与公共流程

共 5 条

模型不再只是聊天或生成内容,而是在药物化学、生命科学评测和政务审批中承担更长链条的工作。

OpenAI @OpenAI

OpenAI 称 GPT-5.4 与 Maria AI 及专业实验室配合,推动一个药物化学项目从文献回顾走到已验证实验结果,模型提出了改进常用反应的意外路径。

♥ 2.0k⇄ 184✎ 138原帖 ↗
OpenAI @OpenAI

Maria 对 10,080 个反应进行了测试,人类化学家手工验证代表性结果;优化条件下,多数 boronic acids 和 sulfonamides 的产率提升。

♥ 133⇄ 5✎ 5原帖 ↗
OpenAI @OpenAI

OpenAI 发布 LifeSciBench,用 173 位生物技术和药物研究科学家编写的 750 个任务,评估 AI 对真实生命科学研究流程的支持能力。

♥ 1.5k⇄ 145✎ 116原帖 ↗
Google DeepMind @GoogleDeepMind

Google DeepMind 与英国政府相关部门合作开发 AI 住房规划申请原型,目标是减少重复劳动,让规划人员把注意力放到复杂项目上,并可能将处理时间缩短最多 50%。

♥ 235⇄ 35✎ 32原帖 ↗
Greg Brockman @gdb

Greg Brockman 转述 AI 帮助破解健康谜题的案例,把它作为对 AI 保持兴奋的现实动机。

♥ 735⇄ 58✎ 79原帖 ↗
§ 第 Ⅱ 章 §
◆

GLM-5.2 与开源模型压力

共 6 条

多位关注人把 GLM-5.2、国产算力栈和 open weight 模型放在同一天讨论,信号集中指向开源与中国 AI 体系的逼近速度。

Zack Korman @ZackKorman

Zack Korman 初步测试认为 GLM-5.2 很擅长发现 agent sandbox escape 和权限绕过问题。

♥ 97⇄ 4✎ 9原帖 ↗
Zack Korman @ZackKorman

他进一步表示 GLM-5.2 几乎一次性打穿自己的 agent sandbox escape workshop,对其越狱能力评价极高。

♥ 209⇄ 16✎ 22原帖 ↗
Emad @EMostaque

Emad 强调 Z.ai 使用 Huawei Ascend 芯片训练而非 NVIDIA,称这是成本低约 90% 的完整中国 AI 栈,并估算总成本约 2500 万美元。

♥ 858⇄ 70✎ 36原帖 ↗
Emad @EMostaque

Emad 判断,如果中国 AI 实验室能获得足够算力,它们超过美国实验室的趋势会越来越清晰。

♥ 875⇄ 47✎ 63原帖 ↗
Bindu Reddy @bindureddy

Bindu Reddy 认为 GLM-5.2 在 benchmark 上非常强,部分指标超过 Opus 4.8 和 GPT 5.5,但也提醒它可能针对 benchmark 做了强化,内部评测仍需谨慎看待。

♥ 279⇄ 16✎ 35原帖 ↗
Bindu Reddy @bindureddy

Bindu Reddy 预告 Abacus AI 的开源 Dragon 模型,称开源已接近闭源能力,并在打造适合小型 agentic loops 和大规模并行任务的 Smaug-Flash。

♥ 63⇄ 3✎ 14原帖 ↗
§ 第 Ⅲ 章 §
◆

软件工程与 Agentic 编排重写

共 4 条

软件工程的变化速度、代码生成能力和 agent 编排方式成为共同话题,指向开发流程本身的重构。

Greg Brockman @gdb

Greg Brockman 感叹软件工程已经变得完全不同,甚至很难回忆 6 个月前的开发状态。

♥ 6.4k⇄ 364✎ 372原帖 ↗
Zack Korman @ZackKorman

Zack Korman 让 GLM-5.2 根据几页营销材料和三句话 prompt 为创业公司生成网站,展示模型从粗输入直接产出前端页面的能力。

♥ 58⇄ 1✎ 21原帖 ↗
Stanford AI Lab @StanfordAILab

Stanford AI Lab 推荐 DeLM 相关报道,主题是如何在没有中央 orchestrator 的情况下编排 agents。

♥ 16⇄ 6✎ 3原帖 ↗
Berkeley AI Research @berkeley_ai

Berkeley AI Research 转发长周期编程研究,问题是 AI coding agents 和顶尖程序员在 long horizon 任务上谁更能 scale。

♥ 0⇄ 40✎ 0原帖 ↗
§ 第 Ⅳ 章 §
◆

实时多模态产品化

共 3 条

从 GPT-Realtime-2 到 Gemini Live,实时对话、视觉输入、工具调用和图像生成正在被打包成更自然的用户入口。

Greg Brockman @gdb

Greg Brockman 称 GPT-Realtime-2 是一个新东西,释放出 OpenAI 在实时交互方向继续推进的信号。

♥ 2.5k⇄ 122✎ 93原帖 ↗
Google Gemini @GeminiApp

Gemini 推出 Nano Banana 2 模板,用户可以把自拍转换成球队主题的 trading cards、murals、cartoons 等视觉内容。

♥ 246⇄ 30✎ 26原帖 ↗
Google Gemini @GeminiApp

Gemini 介绍 Gemini Live 社区演示,重点是持续对话、中途连接工具、让 Gemini 看见用户所见内容,并无缝生成新图像。

♥ 153⇄ 14✎ 9原帖 ↗
§ 第 Ⅴ 章 §
◆

安全、监管与叙事冲突

共 4 条

同一天里既有模型劝服力风险,也有 Anthropic、开源模型和政府态度的争论,AI 安全叙事正在和产业竞争叙事正面碰撞。

Emad @EMostaque

Emad 转发 AI Safety Institute 与 Oxford 相关研究,称 frontier AI 已能在对话中说服专家级人类,包含世界观相关议题。

♥ 0⇄ 199✎ 0原帖 ↗
Zack Korman @ZackKorman

Zack Korman 认为解除 Fable/Mythos 禁令几乎不会改善 cybersecurity,因此不在意政府是否采取这一动作。

♥ 106⇄ 8✎ 14原帖 ↗
Bindu Reddy @bindureddy

Bindu Reddy 批评 Anthropic 员工抱怨政府攻击,认为他们一边宣称技术可能毁灭人类,一边又继续构建该技术,叙事上自相矛盾。

♥ 153⇄ 9✎ 33原帖 ↗
Zack Korman @ZackKorman

Zack Korman 把中国开源权重模型描述为五分之一价格的 OpenAI Opus 级供给,并反驳把这种开放视为坏事的叙事。

♥ 38⇄ 5✎ 13原帖 ↗
§ 第 Ⅵ 章 §
◆

研究方法、招聘与长期脉络

共 4 条

几条非产品帖共同指向同一件事:真正的能力来自问题重构、深度追问和经得起时间检验的基础结构。

Alex Kruger @KrugerSays

Alex Kruger 反对模板化面试题,主张围绕候选人最自豪的一个项目连续追问二十层,直到看见真实能力或很快耗尽细节。

♥ 0⇄ 0✎ 0原帖 ↗
François Chollet @fchollet

François Chollet 提醒,最难的问题通常不是靠给方案增加复杂度解决,而是通过重构问题,让更简单清晰的答案显现。

♥ 1.5k⇄ 168✎ 52原帖 ↗
Microsoft Research @MSFTResearch

Microsoft Research 纪念 ResNet 获 CVPR 2026 Longuet-Higgins Prize,强调 residual connections 十年后仍是现代 AI 系统的基础,引用超过 320,000 次。

♥ 10⇄ 3✎ 0原帖 ↗
Yann LeCun @ylecun

Yann LeCun 转发 JEPA 解释视频,借 30 多年研究脉络回看这一表示学习方向,属于基础概念再解释的信号。

♥ 0⇄ 71✎ 0原帖 ↗
低信号与缺口
本次窗口 raw 帖 57 条,主报告纳入 26 条。52 个关注账号全部抓取成功,失败账号无。窗口内无更新账号包括 Red_Xiao_、ManusAI、OfficialLoganK、AnthropicAI、tydsh、hugo_larochelle、drfeifei、soumithchintala、OriolVinyalsML、goodfellow_ian、ShunyuYao12、NotebookLM、AIatMeta、ilyasut、seb_ruder、sundarpichai、kaifulee、ThomasOrTK、karpathy、demishassabis、timnitGebru、lexfridman、elicollins、BaiduResearch、Metamind、IntelAI、Tesla_AI、IBMResearch、GoogleAI、rowancheung、ID_AA_Carmack、geoffreyhinton、AndrewYNg、sama。steipete、JeffDean、srush_nlp、berkeley_ai 等账号本窗口主要为转推,除少数能构成主题信号的研究类转推外未纳入主报告;wadefoster 的纯链接帖、Yoshua Bengio 的个人荣誉帖以及若干 thread 补充回复未纳入主报告。