X 日报个人阅读

2026 年 6 月 18 日 · 周四

2026-06-17 08:00 至 2026-06-18 08:00(北京时间)

52/52

关注账号覆盖

26

条入选

6

个主题

晨间播报

这一期没有生成音频。

编辑导言

这一期的主旋律很清楚:AI 正在从模型竞赛进入工作现场。OpenAI 把 GPT-5.4 放进药物化学实验循环,Google DeepMind 把 AI 放进住房审批流程,Gemini 把实时对话、视觉理解和图像生成塞进消费级产品。值得看的不是单点能力,而是模型开始接管更长的任务链:读文献、提假设、设计实验、解释数据、生成内容、连接工具。

另一条线更锋利:GLM-5.2 和开源模型被多位关注人集中讨论。它一边在 agent sandbox escape、网页生成和 benchmark 上制造惊喜,另一边引出中国 AI 栈、开源权重、成本结构和闭源公司叙事权的争论。今天的信号不是“谁赢了”,而是 frontier 体验开始被更低成本、更开放的系统逼近。

还有一层更底层的提醒:软件工程、招聘、研究范式和 agent 编排都在被重新定义。真正重要的问题不再只是模型强不强,而是人、组织和评估体系如何重新分工。

01AI 进入科研与公共流程

模型不再只是聊天或生成内容,而是在药物化学、生命科学评测和政务审批中承担更长链条的工作。

OpenAI@OpenAI

OpenAI 称 GPT-5.4 与 Maria AI 及专业实验室配合,推动一个药物化学项目从文献回顾走到已验证实验结果,模型提出了改进常用反应的意外路径。

赞 2.0k转 184评 138原帖 ↗
OpenAI@OpenAI

Maria 对 10,080 个反应进行了测试,人类化学家手工验证代表性结果;优化条件下,多数 boronic acids 和 sulfonamides 的产率提升。

赞 133转 5评 5原帖 ↗
OpenAI@OpenAI

OpenAI 发布 LifeSciBench,用 173 位生物技术和药物研究科学家编写的 750 个任务,评估 AI 对真实生命科学研究流程的支持能力。

赞 1.5k转 145评 116原帖 ↗
Google DeepMind@GoogleDeepMind

Google DeepMind 与英国政府相关部门合作开发 AI 住房规划申请原型,目标是减少重复劳动,让规划人员把注意力放到复杂项目上,并可能将处理时间缩短最多 50%。

赞 235转 35评 32原帖 ↗
Greg Brockman@gdb

Greg Brockman 转述 AI 帮助破解健康谜题的案例,把它作为对 AI 保持兴奋的现实动机。

赞 735转 58评 79原帖 ↗

02GLM-5.2 与开源模型压力

多位关注人把 GLM-5.2、国产算力栈和 open weight 模型放在同一天讨论,信号集中指向开源与中国 AI 体系的逼近速度。

Zack Korman@ZackKorman

Zack Korman 初步测试认为 GLM-5.2 很擅长发现 agent sandbox escape 和权限绕过问题。

赞 97转 4评 9原帖 ↗
Zack Korman@ZackKorman

他进一步表示 GLM-5.2 几乎一次性打穿自己的 agent sandbox escape workshop,对其越狱能力评价极高。

赞 209转 16评 22原帖 ↗
Emad@EMostaque

Emad 强调 Z.ai 使用 Huawei Ascend 芯片训练而非 NVIDIA,称这是成本低约 90% 的完整中国 AI 栈,并估算总成本约 2500 万美元。

赞 858转 70评 36原帖 ↗
Emad@EMostaque

Emad 判断,如果中国 AI 实验室能获得足够算力,它们超过美国实验室的趋势会越来越清晰。

赞 875转 47评 63原帖 ↗
Bindu Reddy@bindureddy

Bindu Reddy 认为 GLM-5.2 在 benchmark 上非常强,部分指标超过 Opus 4.8 和 GPT 5.5,但也提醒它可能针对 benchmark 做了强化,内部评测仍需谨慎看待。

赞 279转 16评 35原帖 ↗
Bindu Reddy@bindureddy

Bindu Reddy 预告 Abacus AI 的开源 Dragon 模型,称开源已接近闭源能力,并在打造适合小型 agentic loops 和大规模并行任务的 Smaug-Flash。

赞 63转 3评 14原帖 ↗

03软件工程与 Agentic 编排重写

软件工程的变化速度、代码生成能力和 agent 编排方式成为共同话题,指向开发流程本身的重构。

Greg Brockman@gdb

Greg Brockman 感叹软件工程已经变得完全不同,甚至很难回忆 6 个月前的开发状态。

赞 6.4k转 364评 372原帖 ↗
Zack Korman@ZackKorman

Zack Korman 让 GLM-5.2 根据几页营销材料和三句话 prompt 为创业公司生成网站,展示模型从粗输入直接产出前端页面的能力。

赞 58转 1评 21原帖 ↗
Stanford AI Lab@StanfordAILab

Stanford AI Lab 推荐 DeLM 相关报道,主题是如何在没有中央 orchestrator 的情况下编排 agents。

赞 16转 6评 3原帖 ↗
Berkeley AI Research@berkeley_ai

Berkeley AI Research 转发长周期编程研究,问题是 AI coding agents 和顶尖程序员在 long horizon 任务上谁更能 scale。

赞 0转 40评 0原帖 ↗

04实时多模态产品化

从 GPT-Realtime-2 到 Gemini Live,实时对话、视觉输入、工具调用和图像生成正在被打包成更自然的用户入口。

Greg Brockman@gdb

Greg Brockman 称 GPT-Realtime-2 是一个新东西,释放出 OpenAI 在实时交互方向继续推进的信号。

赞 2.5k转 122评 93原帖 ↗
Google Gemini@GeminiApp

Gemini 推出 Nano Banana 2 模板,用户可以把自拍转换成球队主题的 trading cards、murals、cartoons 等视觉内容。

赞 246转 30评 26原帖 ↗
Google Gemini@GeminiApp

Gemini 介绍 Gemini Live 社区演示,重点是持续对话、中途连接工具、让 Gemini 看见用户所见内容,并无缝生成新图像。

赞 153转 14评 9原帖 ↗

05安全、监管与叙事冲突

同一天里既有模型劝服力风险,也有 Anthropic、开源模型和政府态度的争论,AI 安全叙事正在和产业竞争叙事正面碰撞。

Emad@EMostaque

Emad 转发 AI Safety Institute 与 Oxford 相关研究,称 frontier AI 已能在对话中说服专家级人类,包含世界观相关议题。

赞 0转 199评 0原帖 ↗
Zack Korman@ZackKorman

Zack Korman 认为解除 Fable/Mythos 禁令几乎不会改善 cybersecurity,因此不在意政府是否采取这一动作。

赞 106转 8评 14原帖 ↗
Bindu Reddy@bindureddy

Bindu Reddy 批评 Anthropic 员工抱怨政府攻击,认为他们一边宣称技术可能毁灭人类,一边又继续构建该技术,叙事上自相矛盾。

赞 153转 9评 33原帖 ↗
Zack Korman@ZackKorman

Zack Korman 把中国开源权重模型描述为五分之一价格的 OpenAI Opus 级供给,并反驳把这种开放视为坏事的叙事。

赞 38转 5评 13原帖 ↗

06研究方法、招聘与长期脉络

几条非产品帖共同指向同一件事:真正的能力来自问题重构、深度追问和经得起时间检验的基础结构。

Alex Kruger@KrugerSays

Alex Kruger 反对模板化面试题,主张围绕候选人最自豪的一个项目连续追问二十层,直到看见真实能力或很快耗尽细节。

赞 0转 0评 0原帖 ↗
François Chollet@fchollet

François Chollet 提醒,最难的问题通常不是靠给方案增加复杂度解决,而是通过重构问题,让更简单清晰的答案显现。

赞 1.5k转 168评 52原帖 ↗
Microsoft Research@MSFTResearch

Microsoft Research 纪念 ResNet 获 CVPR 2026 Longuet-Higgins Prize,强调 residual connections 十年后仍是现代 AI 系统的基础,引用超过 320,000 次。

赞 10转 3评 0原帖 ↗
Yann LeCun@ylecun

Yann LeCun 转发 JEPA 解释视频,借 30 多年研究脉络回看这一表示学习方向,属于基础概念再解释的信号。

赞 0转 71评 0原帖 ↗
低信号与抓取缺口

本次窗口 raw 帖 57 条,主报告纳入 26 条。52 个关注账号全部抓取成功,失败账号无。窗口内无更新账号包括 Red_Xiao_、ManusAI、OfficialLoganK、AnthropicAI、tydsh、hugo_larochelle、drfeifei、soumithchintala、OriolVinyalsML、goodfellow_ian、ShunyuYao12、NotebookLM、AIatMeta、ilyasut、seb_ruder、sundarpichai、kaifulee、ThomasOrTK、karpathy、demishassabis、timnitGebru、lexfridman、elicollins、BaiduResearch、Metamind、IntelAI、Tesla_AI、IBMResearch、GoogleAI、rowancheung、ID_AA_Carmack、geoffreyhinton、AndrewYNg、sama。steipete、JeffDean、srush_nlp、berkeley_ai 等账号本窗口主要为转推,除少数能构成主题信号的研究类转推外未纳入主报告;wadefoster 的纯链接帖、Yoshua Bengio 的个人荣誉帖以及若干 thread 补充回复未纳入主报告。