OpenAI 预览 GPT-5.6 Sol 的 Ultrafast 模式,最高可达原速度的 14 倍,先向部分 API 客户开放。
X 日报个人阅读
2026 年 8 月 14 日 · 周五
2026-08-13 08:00 至 2026-08-14 08:00(北京时间)
关注账号覆盖
条入选
个主题
晨间播报
开车或走路时直接听;会记住播放速度和上次听到的位置。下载 MP3
编辑导言
今天的主旋律不是又多了几个模型名字,而是前沿能力正在被重新定价。OpenAI 用 Ultrafast 把 GPT-5.6 Sol 推到每秒最高 750 tokens,Google 则让 Gemini 3.7 Flash 在提价极小的情况下跨过 AutomationBench 30% 的门槛。模型竞争正从跑分榜走进真实工作流,速度、单任务成本和完整通过率开始比一句“更聪明”更有分量。
另一条线索更值得长期追踪:Agent 正从聊天框向操作系统和企业流程扩张。Computer History、跨设备 Claude 会话、Gemini 的应用连接,以及企业对 skills 和模型路由的使用,都在争夺同一件东西:谁能持续理解上下文,并把意图稳定变成动作。能力供给快速商品化后,真正的差异将落在工作流理解、可信执行和安全边界上。
01模型进入效率战
速度、价格与真实任务通过率同时成为模型竞争的新坐标。
Ultrafast 由 Cerebras 提供算力,生成速度最高 750 tokens/s,目标场景包括实时语音、客服、编程、金融研究与安全响应。
Google DeepMind 发布 Gemini 3.7 Flash,重点提升 coding、knowledge work 与 web development 能力。
Gemini 3.7 Flash 距 3.6 发布仅三周,强化软件工程、Agent 任务与知识工作,限时价格降至 3.6 Flash 原价的一半。
Zapier 的 657 项确定性工作流测试显示,Gemini 3.7 Flash 以接近原成本首次突破 AutomationBench 30%,营销、金融和销售表现突出,但 Operations 仍落后于 Opus 5。
Bindu Reddy 的首日判断是 Grok 4.6 已到 Sonnet 级可用区间,价格有吸引力,并开始承接部分原 Sonnet 工作负载。
02企业落地转向编排
模型变多变便宜之后,企业优势取决于 skills、路由与实施能力。
OpenAI 的企业观察显示,领先 10% 的企业使用 plugins 的频率是普通企业的 2 倍,使用 skills 的频率达到 6 倍,差距来自组织化调用能力而非偶然尝试。
多模型自改进循环的核心是按成本和性能为任务选模型,再用目标与指标驱动长程自动化,而不是把所有任务押在单一模型上。
DeepSeek 与 Grok 的低成本跃升会触发 AI 版 Jevons paradox:单次调用更便宜,企业反而会把更多代码、文档和流程交给 Agent,也提升应用层模型路由的价值。
随着模型持续降价、增强并走向本地化,AI 产品的主要增量将转向应用层:深入理解具体工作流,并据此重做用户体验。
一个简短但明确的组织信号:下一位关键招聘应是 AI Implementation Specialist,负责把模型能力落进真实业务。
03Agent争夺上下文
跨设备记忆、电脑活动与应用连接正在成为个人 Agent 的新入口。
ChatGPT 桌面端推出 Computer History,可记住电脑上应用与网站活动,让后续对话减少重复说明并获得更连续的个人上下文。
Computer History 增加时间线、应用和网站排除、局部清除及暂停能力,并降低 token 消耗,显示长期记忆产品必须把可控性与隐私一起交付。
Claude in Chrome 的会话、skills 与 connectors 可延续到桌面、Web 和移动端,Agent 状态开始归属于账号,而不是被锁在单一设备。
Gemini 新一轮接入 OpenTable、Ticketmaster、Wix、Zocdoc、Zoho 等服务,继续把通用助手变成跨应用执行层。
Peter Yang 判断人机交互将从键鼠操作转向用语音编排云端 Agent,个人电脑也会逐渐云化,而信任将成为产品分水岭。
04推理与安全同场
更强的测试时学习与长程行动能力,也要求更严格的诚实性和攻击面治理。
Chollet 认为 test-time training 在 ARC Prize 2024 后得到验证,目前 ARC 1-2 仍是其显著领先的少数数据集,但这条路线值得进入主流研究。
当前 test-time compute 多用于自然语言搜索与 verifier 循环;另一条路是测试时直接利用梯度训练,价值高但工程成本也更大。
Bengio 警告前沿模型可能出现类似人类的 motivated reasoning,在目标冲突时重构事实为行动辩护,因此训练中的诚实性与内部信念一致性应成为核心约束。
Claude 提醒浏览器 Agent 会受到网页隐藏指令诱导。平台虽已部署防御,用户侧仍需保持授权与操作习惯上的防线。
Korman 认为 AI 不会只单向降低网络攻击门槛,国家授权的反制与威慑也会同步增强,医院和电网遭到无成本滥攻的情形未必如想象中普遍。
05技术回到人的尺度
AI 的价值和批判都必须落到具体人群、具体能力与具体权力关系上。
Google 推出 SL2T 手语转文字模型,让用户首次可直接对手机打手语;产品与 Deaf community 共同开发,体现可及性场景中的协作式 AI。
Timnit Gebru 的新书《Deep Unlearning》开放预订。全书 18 章,试图系统展开她对 AI、知识与权力结构的长期批判。
低信号与抓取缺口
第一类,窗口内零发帖(status=ok 且 window_post_count=0):@Red_Xiao_、@ManusAI、@AnthropicAI、@tydsh、@hugo_larochelle、@drfeifei、@srush_nlp、@soumithchintala、@OriolVinyalsML、@StanfordAILab、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@AIatMeta、@ilyasut、@seb_ruder、@kaifulee、@ylecun、@ThomasOrTK、@karpathy、@lexfridman、@elicollins、@gdb、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@IBMResearch、@MSFTResearch、@rowancheung、@ID_AA_Carmack、@geoffreyhinton、@AndrewYNg、@sama,共 35 个账号,窗口内无更新。第二类,有发帖但未选入主报告:@steipete、@OfficialLoganK、@GeminiApp、@EMostaque、@JeffDean、@GoogleAI,共 6 个账号;内容主要是简短回复、生活话题、低信息量观点,或与已选 Gemini 3.7 Flash 官方发布高度重复,属于发了但未入选。第三类,抓取失败:无,52 个账号状态均为 ok。本次主报告对关注列表严格采用 2026-08-13 08:00 至 2026-08-14 08:00(北京时间)窗口;另混编 6 条 buildernews 近一日外部信号,它们不参与关注账号和精确窗口统计。