今天的主旋律不是又一个模型发布,而是模型发布之后,行业开始用真实工作流追问它到底能不能做事。GPT-6 Astra 的上线经历了混乱、道歉和快速扩围,但更值得看的是 Zapier 与 Box 的评测:能力提升不只体现为完成更多步骤,也体现为知道哪些记录不该动、哪些数据只能称作 proxy。这是 Agent 从演示走向生产必须跨过的一道门。
另一条线索是 AI 正同时向两端扩张。一端深入数学形式化、空间智能和内容生成,另一端渗入编程、个人助理与日常工作流。能力边界扩大得越快,责任归属、基础设施代价和组织如何分配收益就越不能留到事后讨论。本期最值得展开的,正是能力、可用性与责任三者开始在同一天正面碰撞。
发布节奏虽有波折,但真实企业评测开始把关注点从跑分拉回完成度、克制性与成本。
Sam Altman 为混乱的 Astra 上线致歉,并承诺先向 Pro 用户、随后向 API 客户与 ChatGPT 订阅用户扩大开放。
GPT-6 Astra 已进入 ChatGPT Work、Codex 与 API,首批覆盖 Pro、Enterprise 和 Business Premium,Plus 与 Business 用户随后开放。
Zapier 的 AutomationBench 显示,Astra 不只提高工作流完成度,也把“该做什么”和“什么不能改”同时纳入表现;其克制性得分为 68.3%,单任务 token 比上一代少 41%。
早期体验认为 Astra 在 browser use 和 3D 渲染上突出,速度与成本优于 Fable 5.1,但长时间 Agent 循环仍略逊一筹。
Box 的复杂企业知识工作评测中,Astra 总分 77%,高于 Sol 的 74%;更明显的提升出现在媒体分析、区域决策和法律审阅等需要跨文档推理与证据引用的任务。
Peter Yang 指出发布体验的反差:社交媒体持续放大 Astra 的能力,但付费用户一度拿不到权限,模型热度与实际可用性没有同步。
竞争焦点正从单次生成代码,转向技能体系、可扩展入口、网关治理和长时间自主执行。
Andrew Ng 发布 AI Engineering Skills Map,试图把高效使用 coding agents 所需的能力整理为一套可学习、可复用的工程技能。
Abacus AI Agent 推出文本提示生成原生 SwiftUX iOS 应用的能力,并把后端、支付、认证和模型选择纳入同一条生成链路。
Claude Code 团队公开一项早期可扩展性方向,希望让用户能更深地改造工具行为,并在定型前征集真实使用反馈。
Vercel 提供 coding agents 接入 AI Gateway 的统一配置,目标是补齐可用性、观测、预算控制和模型切换,Agent 基础设施正在产品化。
一次短片制作从语音想法生成 spec,再交给 Codex 自主运行数小时,人工活跃投入不到 20 分钟;案例同时披露了工具组合、两轮反馈和 API 成本。
数学验证、空间世界模型、网络安全与生成音乐共同说明,通用模型正在进入更专业的知识和媒介。
Claude 完成费马大定理的首个形式化证明,形成超过 1300 万行 Lean 代码,并补齐证明依赖的 2.9 万多个定理,为机器核验数学知识建立了新规模基准。
Atlas 世界模型以 next view prediction 为关键机制,把像素级生成与三维重建统一起来,目标是推进空间智能对环境的理解与预测。
Google 本周集中更新 Gemini 3.8 Flash、网络安全模型 Flash Cyber、Lyria 3.5、WeatherNext 3 与 Agentic Video Understanding,覆盖代码、多步推理、安全、天气和视频理解。
Lyria 3.5 进入 Gemini,提升编曲层次、演唱表现和音质,并支持类型、纯音乐或人声以及长短曲目选择。
Muse Spark 1.3 的 max reasoning 版本已上线 Muse Code 与 Meta Model API,开发者可直接调用其增强推理档位。
个人 Agent 的价值不再只看对话能力,而取决于能否持续连接上下文、进入协作场景并主动行动。
Gemini Daily Brief 扩大美国免费用户覆盖,在后台连接邮件、日历、对话与兴趣,生成每天可快速浏览的待办和优先级。
Bindu Reddy 认为小模型 Luna 的性能超过 DeepSeek,完成度与在线稳定性优于多种开源变体,适合作为个人 Agent 的常驻模型。
Zack Korman 用 Codex 搭建面向 Agent 的消息板,并加入 GitHub、Telegram 连接器,试图为受网络 allowlist 限制的 Agent 提供协作通道。
现有 chief of staff 产品只连接 GSuite 与 Slack,仍缺手机中的封闭知识、情景记忆和主动推送;没有这些能力,更准确的定位只是效率工具。
从自动驾驶主动介入到 AI 风险叙事,讨论正从模型意图转向证据质量、设计责任和收益分配。
FSD Supervised v14.3.9 增加主动安全介入:当碰撞迫近且 AEB 可能不足,或检测到驾驶员严重分心、误退出 FSD 时,系统可主动接管。
Zack Korman 质疑 METR 对 OpenAI 与 Hugging Face 事件的报告并非中立第三方评估,主张暂停 AI 等政策不能只建立在单一立场的证据上。
Timnit Gebru 批评把数据中心的现实环境成本降格为次要问题,同时用“文明级模型风险”占据叙事中心,认为这种 framing 会遮蔽当下可核查的伤害。
李开复把未来十年的关键问题归为 AI 将去向哪里、组织如何变化、工作如何被重塑,并以新书 AI Native 继续展开这一判断。
Emad 提出由当地居民拥有的新型机构,让 Intelligence Age 的收益能在社区内分配;落地前提是地方意愿、创始委员会与执行团队共同推动。