X 日报个人阅读

2026 年 6 月 11 日 · 周四

2026-06-10 08:00 至 2026-06-11 08:00(北京时间)

50/52

关注账号覆盖

30

条入选

5

个主题

晨间播报

这一期没有生成音频。

编辑导言

这一期的主旋律不是某个单点发布,而是 AI 进入工程化压力测试后的分化:模型能力继续上升,但真正被反复讨论的是成本、恢复能力、开放性、审查边界和治理节奏。Claude Fable 在 agentic coding 场景里被密集试用,有人赞它能从坏 API 中自行恢复,也有人批评它过度思考、受限和昂贵。这个争论比单纯模型榜单更有价值,因为它把模型能力拉回到真实工作流里的可用性问题。

另一个清晰信号来自 Google 系列账号对 DiffusionGemma 的集中发布:文本生成不再只围绕逐 token 预测叙事,block-level diffusion 被包装成速度、格式控制和开放权重的组合拳。与之并行的是 Fei-Fei Li、Anthropic、Kai-Fu Lee、Yann LeCun 等围绕科学工具、政策滞后、开源和中美开放态势的讨论。技术热度仍在,但议题已经从“能不能做”转向“谁能用、以什么成本用、由谁控制”。

低频但值得保留的是一些非模型更新:招聘 JD 应写业务问题而不是人格形容词,Carmack 讲 D&D 的视觉辅助和规则设计,Chollet 拆解泡沫与技术有效性之间的关系。这些内容不在 AI 发布流里,却更像方法论底色:系统要能落地,问题定义、激励机制和判断框架比漂亮叙事更重要。

01Fable 与 Agentic Coding 压力测试

Claude Fable 被迅速放进真实编码与自动化场景,争论焦点从能力展示转向成本、恢复能力和审查边界。

Logan Kilpatrick@OfficialLoganK

祝贺 Anthropic 团队推出 Fable,显示这一新模型或模式已经成为当天 AI 圈的主要话题入口。

赞 4.8k转 83评 232原帖 ↗
Bindu Reddy@bindureddy

Abacus AI Agent 在 ChatLLM 中上线 Claude Fable mode,只把 Fable 用于高难度 coding prompt,其他任务继续走 GPT 5.5、Gemini Flash 等更便宜模型,体现分层调度思路。

赞 1.1k转 68评 68原帖 ↗
Bindu Reddy@bindureddy

她随后补充说 Fable 容易过度思考,只有当常规实用智能模型解决不了难题时才值得启用,并预期 GPT 5.6 会成为日常模型。

赞 127转 7评 28原帖 ↗
Emad@EMostaque

建议尝试 Opus Fable low mode,相比 high 或 ultracost 更省 token,足以半 one-shot 完成多数任务,也可直接让模型寻找最高效做法。

赞 75转 2评 23原帖 ↗
Wade Foster@wadefoster

Zapier 用坏掉的 API 测试 Claude Fable:它没有反复撞同一端点,而是检查工具、拼接数据并完成任务,在 AutomationBench 上刷新高分,强调恢复能力和效率成为新前沿。

赞 19转 2评 4原帖 ↗
Bindu Reddy@bindureddy

向 OpenAI 提出明确产品诉求:希望 GPT 5.6 比 GPT 5.5 少一些限制、便宜一半,说明模型路线竞争已进入价格和边界条件层面。

赞 740转 33评 59原帖 ↗
Bindu Reddy@bindureddy

进一步批评 Fable 太受限、被削弱且过度谨慎,把下一轮 agentic coding 的赌注转向 GPT 5.6。

赞 185转 6评 28原帖 ↗
Yann LeCun@ylecun

转推对 Anthropic 静默降低 Fable 5 AI development 能力的批评,把模型审查、能力削弱和开放研究争论连在一起。

赞 0转 600评 0原帖 ↗

02DiffusionGemma 与开放模型路线

Google 将文本 diffusion 推到 Gemma 体系,主打并行生成、速度提升和 Apache 2.0 权重开放。

Google DeepMind@GoogleDeepMind

发布实验性开放模型 DiffusionGemma,称在专用 GPU 上输出最高可快 4 倍,通过同时生成整块文本而不是逐词预测来提升速度,并支持实时自我修正和复杂 Markdown 格式。

赞 1.7k转 186评 91原帖 ↗
Sundar Pichai@sundarpichai

Sundar Pichai 将 DiffusionGemma 描述为把文本 diffusion 研究带入 Gemma 4 的开放实验模型,强调 block-level 并行生成带来的推理速度优势。

赞 2.3k转 280评 125原帖 ↗
Sundar Pichai@sundarpichai

补充说明模型权重已在 Hugging Face 上以 Apache 2.0 license 发布,开放权重是这次发布的核心卖点之一。

赞 394转 42评 27原帖 ↗
Sasha Rush@srush_nlp

转推 Sundar Pichai 对 DiffusionGemma 的介绍,说明 NLP 研究者也在放大这一开放文本 diffusion 路线。

赞 0转 280评 0原帖 ↗
Demis Hassabis@demishassabis

转推 Google Gemma 对 DiffusionGemma 的发布,强化 DeepMind 领导层对开放 experimental model 的背书。

赞 0转 549评 0原帖 ↗
Kai-Fu Lee@kaifulee

判断中美 AI 发展会在 3 到 15 个月差距间波动,并指出一个反向趋势:中国正变得更开放,美国正变得更封闭。

赞 18转 3评 5原帖 ↗

03开放、治理与科学工具

围绕 AI 科学工具、政策滞后、CEO mandate 和开源风险的讨论同时升温。

Fei-Fei Li@drfeifei

强调科学研究是文明进步的基础,科学家必须能获得当代最好的工具,包括 AI-based tools,用于医学、材料、脑科学和物理等关键问题。

赞 1.9k转 302评 86原帖 ↗
Anthropic@AnthropicAI

Anthropic 引用 Dario Amodei 新文,称 AI 进展速度已经超过政策机构设计能力,技术与治理之间的缺口正成为核心挑战,并宣布三项支持行动。

赞 3.3k转 258评 250原帖 ↗
Anthropic@AnthropicAI

预告将启动 1.5 亿美元 national fellowship program,帮助职业早期人群把 AI 的收益扩展到美国社区。

赞 178转 9评 9原帖 ↗
Anthropic@AnthropicAI

承认这些项目本身不足以解决 advanced AI 挑战,但把它们定义为意图信号,并表示未来会继续扩大相关工作。

赞 119转 4评 15原帖 ↗
Kai-Fu Lee@kaifulee

在 Asia House 分享 01.AI 全球高管合作经验,提出真正的 AI transformation 必须由明确的 CEO mandate 驱动。

赞 29转 3评 5原帖 ↗
Yann LeCun@ylecun

转推关于 AI 最大风险来自权力、能力和经济财富集中的观点,支持 open science 与 open-source 作为对抗集中化的路径。

赞 0转 414评 0原帖 ↗

04研究基准、教育与多 Agent 协作

学术机构的转推集中在 benchmark、AI 教育实验、去中心化多 agent 系统和具身智能资料释放上。

Berkeley AI Research@berkeley_ai

转推关于“AI agents 将在 2026 至 2027 年超过人类多数工作”的说法,并强调构建 exam 来测试这一预测。

赞 0转 95评 0原帖 ↗
Berkeley AI Research@berkeley_ai

转推 Dawn Song 团队与合作者建设 MMLU、MATH、CyberGym、ExploitGym 等 benchmark 的回顾,突出研究社区对评测基础设施的关注。

赞 0转 16评 0原帖 ↗
Google DeepMind@GoogleDeepMind

介绍在 Sierra Leone 教师供给不足背景下,研究 AI 如何作为教育者伙伴来放大教师触达,而不是替代教师专业能力。

赞 95转 11评 17原帖 ↗
Google DeepMind@GoogleDeepMind

补充 8 周评估结果:研究不只看分数,也看行为变化,学生用 AI 理解概念的比例上升,Gemini 中“如何解题”类查询从 68% 升到 90%。

赞 28转 1评 3原帖 ↗
Stanford AI Lab@StanfordAILab

转推关于多 agent 系统不再依赖中央 controller agent 时如何协作的问题,关注 agent 之间通过共享结果进行协调的架构方向。

赞 0转 27评 0原帖 ↗

05判断框架、招聘与游戏系统

几条非发布类内容提供了更底层的方法论:定义问题、识别泡沫、设计规则和利用视觉辅助。

Alex Kruger@KrugerSays

总结招聘 JD 的问题:不要写“战略性、分析性”这类人格标签,而要写清业务哪里坏了、候选人需要解决什么具体问题,能解决过类似问题的人才会被吸引。

赞 2转 0评 0原帖 ↗
François Chollet@fchollet

系统拆解技术泡沫:即使技术有效、有 PMF、有盈利路径甚至当前盈利,也可能因为投资者过度下注和恐慌而形成泡沫。泡沫破裂不等于技术失效。

赞 1.1k转 140评 71原帖 ↗
John Carmack@ID_AA_Carmack

讲自己为 Trista 跑了一场简化版 Dungeons & Dragons,发现玩家自绘模型和怪物视觉辅助显著提升体验,修正了“想象力游戏不需要视觉辅助”的旧偏见。

赞 1.2k转 48评 41原帖 ↗
John Carmack@ID_AA_Carmack

在角色创建时,有玩家主动把好属性分给低点数队友,他觉得这和过去追求点数最大化的玩法不同,是一种更合作的游戏心态。

赞 177转 0评 2原帖 ↗
John Carmack@ID_AA_Carmack

分享自己最喜欢的 house rule“dice extension”:伤害或治疗骰子掷到最大值可继续掷并累加,让普通遭遇也可能自然产生高光叙事。

赞 166转 4评 10原帖 ↗
低信号与抓取缺口

本窗口 raw 帖共 47 条,主报告选入 28 条,转推只在机构背书、开放性争论或研究传播信号较强时纳入。ZackKorman、Yoshua_Bengio 两个账号拉取失败。抓取成功但窗口内无更新的账号包括 Red_Xiao_、ManusAI、tydsh、hugo_larochelle、soumithchintala、OriolVinyalsML、goodfellow_ian、ShunyuYao12、NotebookLM、AIatMeta、ilyasut、seb_ruder、ThomasOrTK、karpathy、timnitGebru、lexfridman、JeffDean、elicollins、gdb、BaiduResearch、Metamind、IntelAI、IBMResearch、MSFTResearch、GoogleAI、rowancheung、geoffreyhinton、AndrewYNg、OpenAI、sama。另有若干低信号短帖或纯链接回复未进入主报告,例如 AGI 玩笑、训练 run 玩笑、单独详情链接和普通服务中断转推。