今天的关注列表不像一个单点发布会,更像一组同时发生的产业体感:模型继续变快、变便宜,agent 从演示走向后台工作流,安全问题也从抽象恐惧落到具体工程责任。OpenAI 和 Google 的信号都在讲同一件事:AI 不再只是聊天框里的能力,而是在浏览器、桌面、日历、语音、机器人和开发流程里寻找新的默认入口。
值得展开的不是哪一个模型名字更热,而是价格、可靠性、工具调用、沙箱、评测和分发渠道正在一起重排。模型侧的竞争把成本压下来,产品侧把 agent 嵌进真实工作,安全侧则提醒大家:当系统有能力替你行动时,环境配置、权限边界和可审计测量会变成组织能力的一部分。
外部 builders feed 也补上了一个现实脚注:真正的 AI adoption 往往不是靠宏大培训,而是靠把工具装到机器上、当场完成一个有意义的任务。今天这期的主线就是从模型能力走向工作系统。
模型竞争的焦点从单纯能力榜转向速度、成本和可部署性,开源与低价模型都在逼近可用拐点。
Bindu 判断 GLM 5.5 可能成为下一波大模型信号:接近 Kimi K3 级别,但更快,也可能更便宜;她认为监管会拖慢 frontier model,开源模型因此有机会追上来。
Emad 把某个小模型发布称作 Kimi K3 级别的冲击:通过 post-training 得到大幅性能提升,模型体积比 GLM 5.2 小三倍、比 K3 小十倍,甚至能在 MacBook 或 Spark 上运行,成本低到每百万 token 0.28 美元以下。
Bindu 表示 DeepSeek Flash 新版本表现很好,已经成为她处理简单任务的常用模型,并强调 ChatLLM 会以不限量方式提供。
Greg 直接评价 luna 是一个好用且低成本的模型,和当天关于价格、速度与大规模使用的讨论相互呼应。
Sam 公布 GPT-5.6 Luna、Terra 和 Sol 的价格与速度调整:Luna 输入价格下降 80%,Sol API 增加 Fast mode,用更高价格换最高 2.5 倍速度,核心表达是按不同层级提供更好的 price/intelligence tradeoff。
Aaron Levie 把 AI 成本下降看作扩散的关键变量:frontier model 会继续承担更复杂任务并显得昂贵,但随后效率提升和竞争会压低单位任务成本,推动更广泛采用。
agent 的落点正在从概念演示转向浏览器、桌面、日历、后台任务和组织培训。
Bindu 预告 AUTOBOTS:递归自我改进的 AI workflows,不需要人持续在环,能从修 bug、做功能到优化广告投放,并会随着时间变得更聪明、更高效。
Bindu 期待 Grok 4.6 支持 parallel tool-use,并能更好处理 long-running tasks;她认为缺少这些能力,就很难扩展大型 agentic loops。
Greg 称 ChatGPT 正在成为 agentic browser,暗示浏览器会从信息入口变成可执行任务的代理层。
Sam 分享 ChatGPT work 的一个用例:连接家庭日历并理解孩子兴趣,每天早晨自动生成上学路上的家庭播客,把足球比赛、生日和新闻串起来。
Gemini Spark 开始向美国以外的 Google AI Pro 用户推出,定位是一个 24/7 后台运行的个人 AI agent,在用户指挥下处理繁重任务。
Josh Woodward 推荐 Gemini Mac app 的语音输入体验:按住 Fn 说话,系统直接在光标位置生成干净、润色后的文本,减少复制粘贴和二次编辑。
Zara 给管理者的建议很实操:训练非技术团队用 AI 时,不要先讲抽象课,直接办 install party,让每个人现场装 agent,并完成一个有意义的任务;安装本身就是 80% 的门槛。
Guillermo Rauch 表示 Vercel 把 CLI 到 Live URL 的端到端部署流程最多削掉约 7 秒,并点名 CLI、MCP、API 可以组合成自主构建和部署软件的平台底座。
agent 事故讨论从“AI 可怕不可怕”转为权限、沙箱、评测和组织安全文化。
Zack 对 AI labs喊话:好的安全文化是认真对待每一次事故,承认不足并改进;坏的安全文化则是把“我们都没抓住”包装成能力边界,从而误判自己。
Zack 用讽刺方式提醒:如果 AI lab 错把核打击权限给了 agent,再用“这说明我们重视安全”来回应,就是把事故话术当治理。
Amjad 认为 sandbox 确实很难,但不少 AI 公司和 sandbox provider 犯的是基础错误;Replit 的经验是默认 zero-day 存在,用 zero-trust 和多层防护来设计系统。
Aaron Levie 认为相关事故的结论不是“AI 很可怕”,而是 agent 时代安全加固极其重要:一旦工具、任务和算力到位,misconfigured system 会自然变成风险向量。
Chollet 呼吁建立开放框架来评估模型行为,把讨论放在可审计测量上,而不是“我们 vs 他们”的情绪对立。
Soumith 表示他们的方案试图让 open weights 与 safety 兼容,希望缓解把开放权重和安全对立起来的政策争论。
从 GCC 对 LLM 代码的态度到 JAX 类型系统,再到 Codex 体验反馈,开发基础设施正在被 AI 工作流重新定义。
Peter 批评 GCC 新政策直接拒绝 LLM-based code,并质疑这种规则在实践中如何证明代码是否由 LLM 生成。
Sasha Rush 提到 JAX 支持带 custom tangents 的 opaque types,一个用途是更好处理批量几何对象,并展示了用 1500 个三角形拟合照片的 differentiable rasterization demo。
Thibault 公开征集 Codex 日常体验改进建议,并强调再小的问题都可以提,说明 coding agent 已进入产品细节打磨阶段。
Swyx 提醒:如果能 distil models,也可以 distil agent harnesses。这把优化对象从模型本体扩展到 agent 运行框架。
AI 的前台体验继续外扩:机器人、图像、语音、头像和 IP 规则一起进入产品讨论。
Google AI 汇总近两周进展:Gemini Robotics 2、Gemini Flash 系列、Flash Cyber、Nano Banana 2、Lyria 3.5 和 NotebookLM Collections,显示 Google 在机器人、agent workflow、图像、音乐和知识组织上同步推进。
Logan 推荐一段与 Google DeepMind Robotics 团队的对话,主题是 Gemini Robotics 2、机器人进展曲线以及下一步方向。
Emad 说“每个像素都会被生成”,并关注 MiniMax AI 的进展,尤其期待权重发布,指向生成式图像和视频基础能力的开放化。
Carmack 长帖讨论 IP 法的社会交换逻辑,并用音乐 mechanical license 作为反例:某些创作权不一定只能靠绝对控制来实现社会收益,IP 制度应持续接受评估。