这一期最值得看的不是谁又登上了能力榜,而是更强的模型能否以更低成本完成一整件事。Anthropic 宣布 Opus 5.5 可用,OpenAI 发布 GPT-6 Sol 与 Luna,并强调 API 降价。比发布口号更有参考价值的是 Zapier 给出的业务工作流测试:执行前去 Slack 找规则、建完工单继续更新客户资料,这些不起眼的步骤,才决定 Agent 能不能交付。总体分数与部门子集成绩也提醒我们,进步不等于已经可以放心放手。
选型仍要按任务拆开看。Bindu Reddy 在同一窗口内先称赞 Opus 5.5 的一次完成能力,随后又表示难编程问题仍选 Fable 5.1;这不是一张总榜能解释的体验差异。另一边,独立评估、监管竞争与网络安全的讨论同步升温。我的编辑判断是:当执行变便宜,团队更该花精力确认成功标准、信息来源和行动边界,而不是只增加调用量。本期仅依据已有关注帖选稿,厂商声明、作者自测与个人观点分别保留其证据身份。
两家厂商同日更新,把比较焦点从模型能力延伸到价格、可用入口与单次任务成本。
Anthropic 宣布 Claude Opus 5.5 当日可用。这条公告未披露评测成绩、价格或具体开放范围,不据此补推规格。
OpenAI 发布 GPT-6 Sol 与 Luna,称它们继承 GPT-6 Astra 的多项优势,定位更快、更便宜的大规模工作场景。官方表示缓存和推理效率提升后,两款模型的 API 价格较 GPT-5.6 促销价再低 50%。
官方称 GPT-6 Sol 与 Luna 当日起在 ChatGPT Work 和 Codex 向 Plus、Pro、Business、Enterprise、Edu 用户推出,同时提供 API;Free 与 Go 用户可在桌面应用尝试 Luna。
Altman 主张用每项任务的成本而非只看 token 单价比较模型,并认为自家产品在这一口径下很有竞争力。这是厂商立场,原帖没有给出跨厂商任务成本对照。
业务流程实测揭示补信息、跨工具执行与推理档位的价值,个人体验则提醒不要把单项优势当作全面领先。
Foster 披露,Opus 5.5 在 Zapier 覆盖六部门、657 项高难业务工作流的 AutomationBench 上总成绩为 40%,运营任务表现较强,HR 和财务较弱。运营子集在 Max effort 下成功率为 62%,Low 为 48%,但 Max 价格是 Low 的两倍。他特别指出,模型会先去 Slack 找供应商贷项规则,再执行发放和记账,建议按流程选择 effort。
Zapier 测试中,GPT-6 Sol 在 xhigh effort 下的 AutomationBench 成绩为 33.2%,此前 GPT-5.6 Sol 为 28.77%。Foster 给出的每百万 token 输入、输出价格分别由 4、20 美元降为 2、10 美元;案例中,新模型不仅将会话转成工单,还按政策更新客户资料,旧模型漏掉了后一步。
Reddy 在发布后的初步体验中高度评价 Opus 5.5 的一次完成能力,并称其比 Opus 5 便宜 25%。原帖未提供任务集或价格细目,应视为个人体验与作者报价,不能当作通用成功率。
同一窗口内,Reddy 又表示 Opus 5.5 在困难编程问题上仍不及 Fable 5.1,计划继续使用后者。与她较早的赞赏并读,更适合得出按任务验证的结论,而非认定某个模型全面胜出。
排障、旅行搜索和用人标准提供了三个观察入口:AI 的价值要落在具体问题与可衡量结果上。
Steinberger 称,升级 macOS 27 后 ChatGPT 偶发崩溃,Astra 在排查过程中发现了 libuv 中一个约 14 年前的 bug。这是作者报告的具体排障案例,现有帖文未提供修复合入或复现验证细节。
Kurian 介绍,Walt Disney World 正利用 Gemini Enterprise 简化度假规划,提供更灵活的搜索与更个性化的结果。该体验即将进入 beta,并非已经全面开放。
Kruger 建议用节省的支出与创造的收入评估 AI 人才,而非只看薪酬:能否替代外包、减少软件支出、自动化工作、避免额外招聘,或建立新的 AI 获客系统。核心是把用人成本放进业务净收益里判断。
独立审查与监管倡议之外,批评者要求关注竞争、现实安全投入和证据质量,而不只讨论未来能力。
Altman 提出,实验室以外的人应参与 AI 发展决策,并有清晰方式判断安全性;标准应防止权力集中,让新公司和开放模型公司能够竞争,也应支持各国与企业比较证据、从失败中学习。他主张由美国牵头推进。
OpenAI 承诺支持独立评估者深入接触训练、评测与部署环节,以挑战内部假设、识别遗漏风险,并独立判断防护措施是否有效。原帖称将列出四个优先评估领域,但未在正文展开,不能据此视为审查已完成。
Bengio 分享电视访谈,称近期观察到的自主 Agent 失准行为凸显监管紧迫性,并介绍 LawZero 开发更安全 AI 的工作。他呼吁扩大公共讨论,强调公民与政策制定者仍有行动空间。
Gebru 批评将模型包装成超强存在的叙事,担心这种话术被用于影响政策制定者、排斥竞争并主导监管。原帖包含对协调宣传的指控,本期仅呈现其批评立场,不将其当作已核实事实。
Korman 用尖锐措辞批评对强大机器的神化,担心这会挤占对网络安全的实际投入。这是一条安全资源分配的观点表达,未给出投资变化数据。
Rush 分享 Conformal Prediction 与 Distribution-Free Uncertainty Quantification 入门材料。相较安全口号,这提供了学习如何表达预测不确定性的技术入口;原帖并未声称该方法可以解决 Agent 安全问题。