这一期的主旋律不是某个单点发布,而是 AI 进入工程化压力测试后的分化:模型能力继续上升,但真正被反复讨论的是成本、恢复能力、开放性、审查边界和治理节奏。Claude Fable 在 agentic coding 场景里被密集试用,有人赞它能从坏 API 中自行恢复,也有人批评它过度思考、受限和昂贵。这个争论比单纯模型榜单更有价值,因为它把模型能力拉回到真实工作流里的可用性问题。
另一个清晰信号来自 Google 系列账号对 DiffusionGemma 的集中发布:文本生成不再只围绕逐 token 预测叙事,block-level diffusion 被包装成速度、格式控制和开放权重的组合拳。与之并行的是 Fei-Fei Li、Anthropic、Kai-Fu Lee、Yann LeCun 等围绕科学工具、政策滞后、开源和中美开放态势的讨论。技术热度仍在,但议题已经从“能不能做”转向“谁能用、以什么成本用、由谁控制”。
低频但值得保留的是一些非模型更新:招聘 JD 应写业务问题而不是人格形容词,Carmack 讲 D&D 的视觉辅助和规则设计,Chollet 拆解泡沫与技术有效性之间的关系。这些内容不在 AI 发布流里,却更像方法论底色:系统要能落地,问题定义、激励机制和判断框架比漂亮叙事更重要。
Claude Fable 被迅速放进真实编码与自动化场景,争论焦点从能力展示转向成本、恢复能力和审查边界。
祝贺 Anthropic 团队推出 Fable,显示这一新模型或模式已经成为当天 AI 圈的主要话题入口。
Abacus AI Agent 在 ChatLLM 中上线 Claude Fable mode,只把 Fable 用于高难度 coding prompt,其他任务继续走 GPT 5.5、Gemini Flash 等更便宜模型,体现分层调度思路。
她随后补充说 Fable 容易过度思考,只有当常规实用智能模型解决不了难题时才值得启用,并预期 GPT 5.6 会成为日常模型。
建议尝试 Opus Fable low mode,相比 high 或 ultracost 更省 token,足以半 one-shot 完成多数任务,也可直接让模型寻找最高效做法。
Zapier 用坏掉的 API 测试 Claude Fable:它没有反复撞同一端点,而是检查工具、拼接数据并完成任务,在 AutomationBench 上刷新高分,强调恢复能力和效率成为新前沿。
向 OpenAI 提出明确产品诉求:希望 GPT 5.6 比 GPT 5.5 少一些限制、便宜一半,说明模型路线竞争已进入价格和边界条件层面。
进一步批评 Fable 太受限、被削弱且过度谨慎,把下一轮 agentic coding 的赌注转向 GPT 5.6。
转推对 Anthropic 静默降低 Fable 5 AI development 能力的批评,把模型审查、能力削弱和开放研究争论连在一起。
Google 将文本 diffusion 推到 Gemma 体系,主打并行生成、速度提升和 Apache 2.0 权重开放。
发布实验性开放模型 DiffusionGemma,称在专用 GPU 上输出最高可快 4 倍,通过同时生成整块文本而不是逐词预测来提升速度,并支持实时自我修正和复杂 Markdown 格式。
Sundar Pichai 将 DiffusionGemma 描述为把文本 diffusion 研究带入 Gemma 4 的开放实验模型,强调 block-level 并行生成带来的推理速度优势。
补充说明模型权重已在 Hugging Face 上以 Apache 2.0 license 发布,开放权重是这次发布的核心卖点之一。
转推 Sundar Pichai 对 DiffusionGemma 的介绍,说明 NLP 研究者也在放大这一开放文本 diffusion 路线。
转推 Google Gemma 对 DiffusionGemma 的发布,强化 DeepMind 领导层对开放 experimental model 的背书。
判断中美 AI 发展会在 3 到 15 个月差距间波动,并指出一个反向趋势:中国正变得更开放,美国正变得更封闭。
围绕 AI 科学工具、政策滞后、CEO mandate 和开源风险的讨论同时升温。
强调科学研究是文明进步的基础,科学家必须能获得当代最好的工具,包括 AI-based tools,用于医学、材料、脑科学和物理等关键问题。
Anthropic 引用 Dario Amodei 新文,称 AI 进展速度已经超过政策机构设计能力,技术与治理之间的缺口正成为核心挑战,并宣布三项支持行动。
预告将启动 1.5 亿美元 national fellowship program,帮助职业早期人群把 AI 的收益扩展到美国社区。
承认这些项目本身不足以解决 advanced AI 挑战,但把它们定义为意图信号,并表示未来会继续扩大相关工作。
在 Asia House 分享 01.AI 全球高管合作经验,提出真正的 AI transformation 必须由明确的 CEO mandate 驱动。
转推关于 AI 最大风险来自权力、能力和经济财富集中的观点,支持 open science 与 open-source 作为对抗集中化的路径。
学术机构的转推集中在 benchmark、AI 教育实验、去中心化多 agent 系统和具身智能资料释放上。
转推关于“AI agents 将在 2026 至 2027 年超过人类多数工作”的说法,并强调构建 exam 来测试这一预测。
转推 Dawn Song 团队与合作者建设 MMLU、MATH、CyberGym、ExploitGym 等 benchmark 的回顾,突出研究社区对评测基础设施的关注。
介绍在 Sierra Leone 教师供给不足背景下,研究 AI 如何作为教育者伙伴来放大教师触达,而不是替代教师专业能力。
补充 8 周评估结果:研究不只看分数,也看行为变化,学生用 AI 理解概念的比例上升,Gemini 中“如何解题”类查询从 68% 升到 90%。
转推关于多 agent 系统不再依赖中央 controller agent 时如何协作的问题,关注 agent 之间通过共享结果进行协调的架构方向。
几条非发布类内容提供了更底层的方法论:定义问题、识别泡沫、设计规则和利用视觉辅助。
总结招聘 JD 的问题:不要写“战略性、分析性”这类人格标签,而要写清业务哪里坏了、候选人需要解决什么具体问题,能解决过类似问题的人才会被吸引。
系统拆解技术泡沫:即使技术有效、有 PMF、有盈利路径甚至当前盈利,也可能因为投资者过度下注和恐慌而形成泡沫。泡沫破裂不等于技术失效。
讲自己为 Trista 跑了一场简化版 Dungeons & Dragons,发现玩家自绘模型和怪物视觉辅助显著提升体验,修正了“想象力游戏不需要视觉辅助”的旧偏见。
在角色创建时,有玩家主动把好属性分给低点数队友,他觉得这和过去追求点数最大化的玩法不同,是一种更合作的游戏心态。
分享自己最喜欢的 house rule“dice extension”:伤害或治疗骰子掷到最大值可继续掷并累加,让普通遭遇也可能自然产生高光叙事。