这一期的主旋律很清楚:模型竞争正在从单点榜单转向真实工作流。Kimi K3 引发的争议不是简单的开源模型追赶闭源模型,而是把企业 AI 栈里的 eval、routing、成本、延迟和模型可替换性都摆到了台面上。外部 builder 的讨论也在呼应同一件事:模型本身重要,但系统如何测、如何换、如何编排,正在变成更核心的能力。
另一条线是 OpenAI 在 Codex、Sol、Terra 和安全场景上的集中发声。关注列表里 OpenAI、Greg Brockman、Sam Altman 和 Peter Steinberger 的帖子构成了一个完整截面:官方强调 cyber 与 Codex Security,实践者则在真实代码审查里比较 Terra high、Sol low、速度和成本。这里的信号不是某个模型名又变强了,而是 AI 编程正在进入更细的分工:安全扫描、代码 review、桌面工作流、模型档位选择,都开始被按场景拆开。
最后,企业落地的故事比口号更值得看。Manus 的 Ascendea 案例、Boris Cherny 对 Claude 自动化等级的拆解、Andrew Ng 的快速推理课程、NotebookLM 的增长信号,都在讲同一个方向:agent 不是只在 demo 里跑,它开始进入组织流程、知识系统和延迟敏感应用。今天的报纸不是低信号日,真正稀缺的是从热闹发布里拆出可迁移的工作方法。
Kimi K3 把开放模型讨论从性能榜单推向企业模型栈、成本结构和中国开放模型策略。
Emad 判断中国公司愿意发布开放模型,是因为开放智能对中国的收益最大:十亿级人群可以更快、更便宜地获得能力升级,同时中国也具备规模化基础设施优势。
Bindu Reddy 认为 Kimi K3 缩小了差距,是最强的好用开源模型之一,但在 LiveBench 的隐藏题和复杂 agentic loop 上仍落后于 Opus 4.8、Sol 和 Fable。
Sasha Rush 用标注图调侃 K3 里仍有大量 Transformer 结构,虽然带着玩笑语气,但也承认这是一个很酷的模型。
Guillermo Rauch 称 Kimi K3 在 web engineering benchmark 上超过 Fable,以更短时间达到可比成功率,认为这是开放模型突破闭源模型的一条重要信号,同时提醒 benchmark 仍不能代表全部。
Aaron Levie 认为开放模型的性能和成本下降会扩大企业可落地的 AI workflow,应用层可以基于多模型组合、调优和路由拿到更多价值。
Madhu Guru 把 Kimi、GLM 这类 open-weight 模型上升到企业 AI 栈重构:企业需要 eval、model routing 和 model-agnostic harness,把模型切换能力做成系统能力。
Aditya Agarwal 直接从采购视角发问:如果存在好用且免费的替代模型,为什么还要继续为 Fable 付费。这代表开放模型对商业模型定价的现实冲击。
OpenAI 集中推 Sol 和 Codex Security,实践者则在真实代码审查里比较 Terra 的速度、成本和质量。
OpenAI 宣称 GPT-5.6 Sol 在 The Last Ones cyber range 上刷新网络安全能力,并已能帮助团队在真实代码中发现、验证和修复漏洞,入口是 Codex Security。
Greg Brockman 强调 GPT-5.6 Sol 已是 cyber 场景的 SOTA,重点是帮助防守方发现并修复新型漏洞,而不是泛泛展示攻击能力。
OpenAI 给出 Codex Security 插件的使用路径:在 Codex 中安装插件,选择代码目录,发送预置扫描 prompt,启动安全扫描。
Peter Steinberger 把 GitHub review bot 切到 5.6 Terra high,反馈是总体快约 40%,质量损失可以忽略,成本也显著更低。
Peter Steinberger 用自己的 issue 和 code review 场景反驳盲信 benchmark:对他的用例来说,Terra high 明显优于 Sol low。
Greg Brockman 用一句话提醒不要忽视 Terra,和 Peter 的实测反馈形成呼应:模型档位的价值要按具体工作负载判断。
围绕 Codex、Claude、Claw 和多 agent 的讨论,核心已从单次生成转向验证、权限、隔离和并行调度。
John Carmack 记录 Claude 对 clamp 必要性的解释:模型的措辞有点阴阳怪气,但技术理由成立,因为不同规约路径仍可能导致 sqrt(-epsilon) 风险。
Peter Steinberger 展示 Molty 实时吐槽 GitHub commits,把代码流、审查和团队反馈做成更轻量的开发现场感。
Peter 说不能一味把所有任务都丢给最高档模型,真正有价值的是探索怎样按任务类型正确使用模型。
Boris Cherny 把可信 AI 编程拆成端到端自验证、auto permissions、自动 code review 与 security review、多 agent 管理,以及 /loop、/batch、动态 workflow 和 worktree 隔离。
Boris Cherny 提醒团队衡量 AI 编程不能只看 usage dashboard,更好的问题是这些工作本来会不会花工程时间,以及节省了多少手工 eng-hours。
Dan Shipper 复盘 OpenAI Codex 线的产品节奏:先错过 Claude Code 式 agentic coding,再由小团队做出独立 Codex 模型线和 Desktop app,最后成功合回主产品。
Manus 与 Box 的案例共同指向一个现实趋势:agent 的价值来自进入组织数据、流程和判断链。
Manus 介绍 Ascendea:10 人团队服务 112 个客户,运行 28 到 33 条 live workflows,核心是一位 AI Chief of Staff,把小企业 CRM 服务的产能放大到 90 倍。
Ascendea 把 Manus 固定为内部角色 James,并用它整理授权团队沟通中的知识,一天内沉淀 303 份 SOP,成为运营系统的基础。
Manus 描述 Ascendea 的三层 workforce:6 个本地 agents 做计划任务,3 个 Slack agents 提供日常入口,复杂问题再上升到 Manus。
Manus 强调即使自动化深入流程,最终判断仍由团队保留;agent 承担执行放大,人类负责方向和决策。
Aaron Levie 介绍 Box 与 Databricks 的连接,让企业可以在不搬移、不重新处理内容的情况下查询合同、财务、供应链等非结构化文档数据。
ChatGPT、NotebookLM 与新 voice model 的更新说明,AI 产品正在从单点能力变成跨端、跨任务、跨知识库的工作入口。
Greg Brockman 推 ChatGPT Work 在个人生活任务里的用途,并补充团队正在快速响应反馈、持续迭代。
Thibault Sottiaux 详述 ChatGPT desktop app 更新:历史和项目进入侧边栏,Chat 与 Work 历史跨 web、mobile、desktop 同步,Chat/Work 模式切换也更一致。
Josh Woodward 回顾 Notebook 从内部小项目成长为 3000 万用户、60 万组织使用的产品,并宣布外部命名正式化。
Google Labs 把 NotebookLM 的前身 Project Tailwind 拉回视野,强调这个 Labs 实验已经演进为 Gemini Notebook 方向的一部分。
Sam Altman 说自己现在和 ChatGPT 说话多过打字,新的 voice model 已经跨过一个阈值,语音交互正在从补充入口变成主入口。
快速推理、工业级算力和新研究实验室,构成了能力扩张背后的基础设施与研究分支。
Andrew Ng 发布与 Cerebras 合作的短课,主题是用快速推理硬件构建低延迟 LLM 应用,覆盖 GPU、TPU 与 Wafer-Scale Engine 的内存到计算瓶颈差异。
Matt Turck 的访谈梳理 OpenAI industrial compute:Stargate、Jalapeño 自研芯片、tokens per watt、供电、液冷、融资和数据中心选址,呈现 AI 基建的工业化复杂度。
François Chollet 提到 AfterLab 从 stealth 状态走出,定位是研究 efficient fluid intelligence 的不同路径,并祝贺创始团队完成融资。
Zara Zhang 关注中国硬件想法:一款口罩同时作为麦克风,让用户可以在公共场合语音输入而不被旁人听见,指向语音 AI 的现实使用摩擦。