本期几乎被 GPT-6 Astra 改写议程,但真正值得看的不是又一轮发布声量,而是模型开始把过去依赖复杂 harness 的能力收进自身。ARC-AGI-3、AutomationBench 和真实开源项目给出了不同侧面的证据,同时也迅速暴露旧基准趋于饱和、公开可用性落后于宣传、真实长任务仍缺少可靠测量等问题。能力跃迁与评价体系失效,在同一天发生了。
另一条更安静却更接近日常的线索,是 AI 正从对话框进入后台流程。语音整理、会议转写、桌面 computer use 和 Workspace 操作都在把零散信息变成可继续执行的上下文。与此同时,WeatherNext 3 把全球预报更新推进到每小时一次,说明模型价值开始落在高频、具体、可验证的现实系统中。
争论也没有因能力进展而消失。是否保持 human in the loop、如何避免安全叙事滑向末日论、开放权重能否同时承担创新与隐私信任,正在从理念之争变成产品和组织必须回答的设计问题。
GPT-6 Astra 的核心变化不是更会回答,而是更能在计算机、代码和复杂业务流程中完成整段任务。
OpenAI 正式发布 GPT-6 Astra,主张它能代用户完成计算机上的各类任务,并把 computer use、浏览、软件工程、网络安全、科学和专业工作列为重点能力。
Astra 在标准 ARC-AGI-3 harness 上得分 66%,在持续对话和自定义上下文压缩下接近满分。Chollet 观察到模型会即时建立符号化世界模型,甚至生成游戏专用 DSL,过去依赖复杂 harness 的能力正在内化到模型本身。
Zapier 的 AutomationBench 给 Astra 41.4%,首次有模型突破 40%。它尤其擅长从混乱来源中找齐规则并完成财务、运营和支持任务,找不到关键规范时会停下而不是猜测。
Steinberger 称自己已使用 Astra 数周,模型表现主动,曾在调试 OC 时一路定位并修补 vitest、tsx 和 SwiftPM 的上游依赖问题,给出了来自真实软件工程的验证。
模型半年内从低于 1% 走到接近饱和,评价体系必须转向更长、更真实、更难压缩的任务。
Chollet 明确提醒,ARC-AGI-3 接近满分不等于 AGI。该基准只在小规模环境中测试不确定探索、因果建模和无指令适应,与真实世界任务在时长、数据量和复杂度上仍有数量级差距。
AI benchmark 必须与模型共同演化,在旧题被攻克后继续追踪人类智能的剩余优势。ARC-AGI-4 已在开发,计划于 2027 年第一季度推出。
Reddy 判断现有 AI benchmarks 已普遍失效或饱和,关键缺口是无法测试真实世界的长时间运行循环,并预告将发布针对这一问题的新 benchmark。
Terminal-Bench-Science 发布仅一周就被头部模型用作能力证明,说明新的科学任务基准正在快速进入模型发布的核心评价体系。
能力越接近自主执行,human in the loop、安全论证和监管尺度越需要从口号变成系统边界。
Chollet 主张在经济与社会的关键流程中主动保留 human in the loop,即使技术上已经可以去掉人。核心不是限制能力,而是保持控制、可见性与对过程的理解。
Korman 区分了支持 AI safety 与支持末日论或暂停研发,表明安全讨论内部的分歧正集中到风险治理是否必然导向停滞。
Gebru 批评以拟人化和神秘化叙事解释模型风险,同时把封闭模型包装成保护公众的必要手段;她将中国开放权重模型的推进视为对这套叙事和商业模式的现实反证。
产品重心正从生成答案转向持续读取上下文、操作应用并在后台完成后续动作。
Gemini 新语音能力开始向 Google AI 订阅用户推送,可通过对话搜索 Gmail、整理 Keep 中的想法与任务,并创建 Docs,语音入口正在连接 Workspace 的实际操作。
Cheung 分享了一条无键盘的个人知识流水线:用 Wispr Flow 把会后口述写入 Apple Notes,夜间由 Claude 定时整理进 Notion,提取行动项并建议 Google Calendar 深度工作时段。
Claude 宣布 Cowork 和 Claude Code 可以在后台使用计算机,用户布置桌面任务后,模型能在不占用前台工作的情况下点击、输入和打开应用。
Zhang 认为会议转写的主要消费者正在从人变成 agent:记录不再只是供人回看或阅读摘要,而是给后续自动执行提供上下文。
模型竞争开始同时核算能力迭代速度、API 毛利、任务可靠性和从发布到真正可用的时间差。
Chintala 摘录 Z.ai 财报要点:业务路径从 Chat、Coding 走向 Agent、Cowork 和 Autonomous AI;2026 年上半年收入 1.42 亿美元、同比近 400%,开放平台与 API 毛利率升至 24.6%,但研发资金仍主要依赖资产负债表。
Reddy 称 Astra 定价与 Fable 5.1 相同,为每百万 input tokens 10 美元、output tokens 50 美元,但尚未全面开放。
Reddy 提醒 OpenAI 尽快把 Astra 从发布会推向普遍可用,否则复杂工作负载一旦迁移到 Fable 5.1,后续切换成本会持续上升。
Guru 主张 AI 产品应替用户隐藏模型选择。做到这一点需要理解不同量级模型的能力边界、为真实 workflow 建立 evals,并让团队持续跟随模型前沿调整路由。
WeatherNext 3 直接吸收实时观测,把全球天气预测从低频模拟推进到每小时更新和更细空间分辨率。
Google DeepMind 发布 WeatherNext 3,模型直接学习现实世界的实时观测,以更快速度提供更本地化的全球天气预测。
传统计算约束通常让天气预报每六小时更新一次,WeatherNext 3 直接读取实时卫星数据,可每小时启动一轮新的全球预测。
WeatherNext 3 将全球降水预测误差最多降低 50%,提升最明显的恰是历史上预测可靠性较弱的地区。
Google AI 强调 WeatherNext 3 相比上一代空间精度最高提升 5 倍,可捕捉快速变化的暴雨、局地温度和风电输出,为高成本传统预报覆盖不足的地区提供更细预测。
Hugging Face 的生态价值与开放权重的隐私意义同时被重申,开放模型正成为基础设施和信任选择。
Pichai 祝贺 Jensen Huang 与 Clement Delangue 达成新进展,并表示 Google 既是 Hugging Face 的投资者也是持续合作伙伴,相关结果将加强开放模型生态。
Mostaque 回顾 Hugging Face 对 Stable Diffusion 发布和规模化的关键作用,认为其团队长期为 open source 提供了高参与度的基础设施支持。
Agarwal 认为用户很难仅凭承诺相信前沿实验室不会拿数据训练模型,因此隐私需求本身构成使用 OSS 模型的理由,也凸显美国开放权重生态的重要性。