今天的关注列表不是发布会节奏,而是几条更底层的线索同时冒头:开放权重模型仍在和安全叙事拉扯,中国模型的效率优势被反复提及,模型调用成本正在变成产品架构问题,而不是单纯的采购问题。Kimi、DeepSeek、GPT 5.6 SOL、Claude Fable 这些名字背后,真正的主题是智能供给开始进入价格战、路由战和基础设施战。
另一条线更贴近工程现场:coding agent 的能力已经足够强,可以操作浏览器、处理 PR、放大高级工程师的执行力,但它的短板仍然在开放场景下的判断。Chollet 和 Yuandong Tian 的几条帖子把这件事说得很清楚:AI 时代不是不需要工程师,而是更需要能拆问题、下场验证、快速反馈的人。
开放模型的争论从技术路线扩展到监管、地缘与平台利益,安全叙事本身也成了竞争工具。
LeCun 把 Linux 和互联网的成功归因于开放和不可被单点治理,认为 open weight AI foundation models 也会沿着同样逻辑发展。
Zack 指出,曾主张美国政府制造 open weight models 恐慌的人,是 OpenAI 的战略未来负责人,提醒安全讨论背后也有机构立场。
Zack 反驳“大模型公司想让人相信中国 AI 模型特别危险”的说法,认为这误读了 agent security 的真实风险结构。
Emad 预判会出现 KYP 和 ATL 这类类金融监管框架,甚至可能要求使用 frontier models 的专业牌照。
模型竞争正在从单模型能力切换到质量、成本、延迟和路由策略的组合优化。
Bindu 主张用 Kimi K3 替换 Sonnet 工作负载,理由是 K3 相比 Sonnet 4+ 便宜约 50%,性能还更高。
Bindu 把 ChatLLM 的路线描述为按 prompt 自动路由:简单 coding 给 Grok 4.5,中等 agentic 给 Kimi K3,很难的任务给 Fable 5 或 5.6 sol。
Bindu 认为 DeepSeek 的效率优势会继续外溢,可能推出接近 Kimi K3 水平但成本再低一个数量级的模型。
Emad 提到 K3 可以作为 teacher model,并且带 logits,用来训练更小的 dense models,甚至构造万亿 token 级训练数据。
Levie 认为 AI 越便宜,真实工作负载部署越多,总使用量会上升;强模型负责 orchestration,便宜模型承接大部分 token,这会压缩利润但扩大生态。
Madhu 认为很多企业不会直接消费 Kimi,而会通过 Google Cloud 这类平台获取安全、数据驻留、合规和芯片保障,便宜模型也可能回流到云厂商口袋里。
agent 已经能替人跑流程,但真正稀缺的仍是任务拆解、环境隔离和未定义场景下的判断。
Peter 用一句话追问讨论是否已经从 loops 转向 graphs,点出 agent workflow 正在从线性循环走向更复杂的编排结构。
Peter 观察 Codex 为上传一张图而操控 Chrome、打开 PR、点评论、处理 macOS picker,既惊人又痛苦;他把 Codex 放在 VM 里运行,避免抢占本机焦点。
Chollet 区分了模型执行精确指令的能力和在未覆盖场景里做稳健决策的能力:前者提升很快,后者仍然停滞。
Chollet 认为 coding agents 更像快速、便宜但缺乏创造性决策的执行器,它们放大的是 competent engineers,而不是替代工程师。
Madhu 把企业 AI 落地瓶颈归结为 evals、harness 和 talent:能否围绕真实用例建立评测、路由、多 agent 编排、上下文和工具调用系统,才决定能否走出聊天机器人。
Peter Yang 想要能像打电话一样分派和追踪 agent 的语音交互,因为整天盯屏幕管理 agents 会把人耗干。
AI 降低了执行成本,但也让能亲手验证、快速迭代、从实践中长出判断的人更重要。
Chollet 解释 junior engineers 的价值原本不在即时产出,而在随时间获得 competence;真正的风险是 AI 让他们失去成长路径。
Yuandong Tian 认为 LLM 时代尤其需要 down-to-earth doers:亲自看数据和代码,快速反馈,跳出回音室,愿意承认自己错,让实验暴露问题。
Thariq 认为先做 mockups、schemas、data models 和 proof of concepts,是避免消耗大量 tokens 后才发现方向不对的最好办法。
Zara 给 building in public 的建议是展示产品里已经发生的工作:小录屏、第一版、改变设计的用户行为,推理过程比制作精度更重要。
前沿模型的用户体验正在被容量、限额、芯片与硬件形态直接塑造。
Claude 宣布从 7 月 20 日起,Fable 5 会以 50% limits 纳入 Max 和 Team Premium;Pro 与 Team Standard 用户继续通过 credits 使用,并获得一次性 100 美元 credit。
Thibault 表示已为 Codex 和 ChatGPT Work 的付费用户重置使用限额,侧面说明需求增长和基础设施承压仍在快速变化。
Emad 抛出一个硬件需求问题:如果 NVIDIA 5090 有 128GB VRAM,用户愿意付多少钱,反映本地高显存算力仍是模型实践者的焦点。
Jeff Dean 解释 TPU pod 命名:pod 代表一组通过高速自定义网络紧密连接的 TPU,比最初 Jellyfish 的海洋生物命名更适合规模化系统。