今天的主旋律不是又多了几个模型名字,而是前沿能力正在被重新定价。OpenAI 用 Ultrafast 把 GPT-5.6 Sol 推到每秒最高 750 tokens,Google 则让 Gemini 3.7 Flash 在提价极小的情况下跨过 AutomationBench 30% 的门槛。模型竞争正从跑分榜走进真实工作流,速度、单任务成本和完整通过率开始比一句“更聪明”更有分量。
另一条线索更值得长期追踪:Agent 正从聊天框向操作系统和企业流程扩张。Computer History、跨设备 Claude 会话、Gemini 的应用连接,以及企业对 skills 和模型路由的使用,都在争夺同一件东西:谁能持续理解上下文,并把意图稳定变成动作。能力供给快速商品化后,真正的差异将落在工作流理解、可信执行和安全边界上。
速度、价格与真实任务通过率同时成为模型竞争的新坐标。
OpenAI 预览 GPT-5.6 Sol 的 Ultrafast 模式,最高可达原速度的 14 倍,先向部分 API 客户开放。
Ultrafast 由 Cerebras 提供算力,生成速度最高 750 tokens/s,目标场景包括实时语音、客服、编程、金融研究与安全响应。
Google DeepMind 发布 Gemini 3.7 Flash,重点提升 coding、knowledge work 与 web development 能力。
Gemini 3.7 Flash 距 3.6 发布仅三周,强化软件工程、Agent 任务与知识工作,限时价格降至 3.6 Flash 原价的一半。
Zapier 的 657 项确定性工作流测试显示,Gemini 3.7 Flash 以接近原成本首次突破 AutomationBench 30%,营销、金融和销售表现突出,但 Operations 仍落后于 Opus 5。
Bindu Reddy 的首日判断是 Grok 4.6 已到 Sonnet 级可用区间,价格有吸引力,并开始承接部分原 Sonnet 工作负载。
模型变多变便宜之后,企业优势取决于 skills、路由与实施能力。
OpenAI 的企业观察显示,领先 10% 的企业使用 plugins 的频率是普通企业的 2 倍,使用 skills 的频率达到 6 倍,差距来自组织化调用能力而非偶然尝试。
多模型自改进循环的核心是按成本和性能为任务选模型,再用目标与指标驱动长程自动化,而不是把所有任务押在单一模型上。
DeepSeek 与 Grok 的低成本跃升会触发 AI 版 Jevons paradox:单次调用更便宜,企业反而会把更多代码、文档和流程交给 Agent,也提升应用层模型路由的价值。
随着模型持续降价、增强并走向本地化,AI 产品的主要增量将转向应用层:深入理解具体工作流,并据此重做用户体验。
一个简短但明确的组织信号:下一位关键招聘应是 AI Implementation Specialist,负责把模型能力落进真实业务。
跨设备记忆、电脑活动与应用连接正在成为个人 Agent 的新入口。
ChatGPT 桌面端推出 Computer History,可记住电脑上应用与网站活动,让后续对话减少重复说明并获得更连续的个人上下文。
Computer History 增加时间线、应用和网站排除、局部清除及暂停能力,并降低 token 消耗,显示长期记忆产品必须把可控性与隐私一起交付。
Claude in Chrome 的会话、skills 与 connectors 可延续到桌面、Web 和移动端,Agent 状态开始归属于账号,而不是被锁在单一设备。
Gemini 新一轮接入 OpenTable、Ticketmaster、Wix、Zocdoc、Zoho 等服务,继续把通用助手变成跨应用执行层。
Peter Yang 判断人机交互将从键鼠操作转向用语音编排云端 Agent,个人电脑也会逐渐云化,而信任将成为产品分水岭。
更强的测试时学习与长程行动能力,也要求更严格的诚实性和攻击面治理。
Chollet 认为 test-time training 在 ARC Prize 2024 后得到验证,目前 ARC 1-2 仍是其显著领先的少数数据集,但这条路线值得进入主流研究。
当前 test-time compute 多用于自然语言搜索与 verifier 循环;另一条路是测试时直接利用梯度训练,价值高但工程成本也更大。
Bengio 警告前沿模型可能出现类似人类的 motivated reasoning,在目标冲突时重构事实为行动辩护,因此训练中的诚实性与内部信念一致性应成为核心约束。
Claude 提醒浏览器 Agent 会受到网页隐藏指令诱导。平台虽已部署防御,用户侧仍需保持授权与操作习惯上的防线。
Korman 认为 AI 不会只单向降低网络攻击门槛,国家授权的反制与威慑也会同步增强,医院和电网遭到无成本滥攻的情形未必如想象中普遍。
AI 的价值和批判都必须落到具体人群、具体能力与具体权力关系上。