Challen · X Following Dispatch No. 20260814

THE FOLLOWING

关注列表·北京时间24小时声音
2026-08-14 ★ 23 条 · 5 个主题 · 52 个账号 ★ COBALT GRID
编辑导言 FROM THE EDITOR

今天的主旋律不是又多了几个模型名字,而是前沿能力正在被重新定价。OpenAI 用 Ultrafast 把 GPT-5.6 Sol 推到每秒最高 750 tokens,Google 则让 Gemini 3.7 Flash 在提价极小的情况下跨过 AutomationBench 30% 的门槛。模型竞争正从跑分榜走进真实工作流,速度、单任务成本和完整通过率开始比一句“更聪明”更有分量。

另一条线索更值得长期追踪:Agent 正从聊天框向操作系统和企业流程扩张。Computer History、跨设备 Claude 会话、Gemini 的应用连接,以及企业对 skills 和模型路由的使用,都在争夺同一件东西:谁能持续理解上下文,并把意图稳定变成动作。能力供给快速商品化后,真正的差异将落在工作流理解、可信执行和安全边界上。

覆盖 52/52 个关注账号 · 23 条入选 · 聚为 5 个主题 · 由 AI 实时归纳,仅供参考
§ 第 Ⅰ 章 §
◆

模型进入效率战

共 6 条

速度、价格与真实任务通过率同时成为模型竞争的新坐标。

OpenAI @OpenAI

OpenAI 预览 GPT-5.6 Sol 的 Ultrafast 模式,最高可达原速度的 14 倍,先向部分 API 客户开放。

♥ 10.9k⇄ 667✎ 533原帖 ↗
OpenAI @OpenAI

Ultrafast 由 Cerebras 提供算力,生成速度最高 750 tokens/s,目标场景包括实时语音、客服、编程、金融研究与安全响应。

♥ 1.4k⇄ 55✎ 15原帖 ↗
Google DeepMind @GoogleDeepMind

Google DeepMind 发布 Gemini 3.7 Flash,重点提升 coding、knowledge work 与 web development 能力。

♥ 3.2k⇄ 396✎ 213原帖 ↗
Sundar Pichai @sundarpichai

Gemini 3.7 Flash 距 3.6 发布仅三周,强化软件工程、Agent 任务与知识工作,限时价格降至 3.6 Flash 原价的一半。

♥ 2.9k⇄ 255✎ 245原帖 ↗
Wade Foster @wadefoster

Zapier 的 657 项确定性工作流测试显示,Gemini 3.7 Flash 以接近原成本首次突破 AutomationBench 30%,营销、金融和销售表现突出,但 Operations 仍落后于 Opus 5。

♥ 77⇄ 10✎ 3原帖 ↗
Bindu Reddy @bindureddy

Bindu Reddy 的首日判断是 Grok 4.6 已到 Sonnet 级可用区间,价格有吸引力,并开始承接部分原 Sonnet 工作负载。

♥ 286⇄ 7✎ 46原帖 ↗
§ 第 Ⅱ 章 §
◆

企业落地转向编排

共 5 条

模型变多变便宜之后,企业优势取决于 skills、路由与实施能力。

OpenAI @OpenAI

OpenAI 的企业观察显示,领先 10% 的企业使用 plugins 的频率是普通企业的 2 倍,使用 skills 的频率达到 6 倍,差距来自组织化调用能力而非偶然尝试。

♥ 3.0k⇄ 140✎ 138原帖 ↗
Bindu Reddy @bindureddy

多模型自改进循环的核心是按成本和性能为任务选模型,再用目标与指标驱动长程自动化,而不是把所有任务押在单一模型上。

♥ 308⇄ 19✎ 42原帖 ↗
Aaron Levie @levie

DeepSeek 与 Grok 的低成本跃升会触发 AI 版 Jevons paradox:单次调用更便宜,企业反而会把更多代码、文档和流程交给 Agent,也提升应用层模型路由的价值。

♥ 212⇄ 13✎ 21原帖 ↗
Madhu Guru @realmadhuguru

随着模型持续降价、增强并走向本地化,AI 产品的主要增量将转向应用层:深入理解具体工作流,并据此重做用户体验。

♥ 178⇄ 12✎ 22原帖 ↗
Alex Kruger @KrugerSays

一个简短但明确的组织信号:下一位关键招聘应是 AI Implementation Specialist,负责把模型能力落进真实业务。

♥ 2⇄ 0✎ 0原帖 ↗
§ 第 Ⅲ 章 §
◆

Agent争夺上下文

共 5 条

跨设备记忆、电脑活动与应用连接正在成为个人 Agent 的新入口。

OpenAI @OpenAI

ChatGPT 桌面端推出 Computer History,可记住电脑上应用与网站活动,让后续对话减少重复说明并获得更连续的个人上下文。

♥ 5.8k⇄ 413✎ 332原帖 ↗
OpenAI @OpenAI

Computer History 增加时间线、应用和网站排除、局部清除及暂停能力,并降低 token 消耗,显示长期记忆产品必须把可控性与隐私一起交付。

♥ 560⇄ 12✎ 16原帖 ↗
Claude @claudeai

Claude in Chrome 的会话、skills 与 connectors 可延续到桌面、Web 和移动端,Agent 状态开始归属于账号,而不是被锁在单一设备。

♥ 8.5k⇄ 615✎ 382原帖 ↗
Josh Woodward @joshwoodward

Gemini 新一轮接入 OpenTable、Ticketmaster、Wix、Zocdoc、Zoho 等服务,继续把通用助手变成跨应用执行层。

♥ 241⇄ 11✎ 20原帖 ↗
Peter Yang @petergyang

Peter Yang 判断人机交互将从键鼠操作转向用语音编排云端 Agent,个人电脑也会逐渐云化,而信任将成为产品分水岭。

♥ 90⇄ 11✎ 14原帖 ↗
§ 第 Ⅳ 章 §
◆

推理与安全同场

共 5 条

更强的测试时学习与长程行动能力,也要求更严格的诚实性和攻击面治理。

François Chollet @fchollet

Chollet 认为 test-time training 在 ARC Prize 2024 后得到验证,目前 ARC 1-2 仍是其显著领先的少数数据集,但这条路线值得进入主流研究。

♥ 206⇄ 12✎ 17原帖 ↗
François Chollet @fchollet

当前 test-time compute 多用于自然语言搜索与 verifier 循环;另一条路是测试时直接利用梯度训练,价值高但工程成本也更大。

♥ 22⇄ 1✎ 3原帖 ↗
Yoshua Bengio @Yoshua_Bengio

Bengio 警告前沿模型可能出现类似人类的 motivated reasoning,在目标冲突时重构事实为行动辩护,因此训练中的诚实性与内部信念一致性应成为核心约束。

♥ 72⇄ 12✎ 3原帖 ↗
Claude @claudeai

Claude 提醒浏览器 Agent 会受到网页隐藏指令诱导。平台虽已部署防御,用户侧仍需保持授权与操作习惯上的防线。

♥ 245⇄ 3✎ 7原帖 ↗
Zack Korman @ZackKorman

Korman 认为 AI 不会只单向降低网络攻击门槛,国家授权的反制与威慑也会同步增强,医院和电网遭到无成本滥攻的情形未必如想象中普遍。

♥ 185⇄ 17✎ 22原帖 ↗
§ 第 Ⅴ 章 §
◆

技术回到人的尺度

共 2 条

AI 的价值和批判都必须落到具体人群、具体能力与具体权力关系上。

Demis Hassabis @demishassabis

Google 推出 SL2T 手语转文字模型,让用户首次可直接对手机打手语;产品与 Deaf community 共同开发,体现可及性场景中的协作式 AI。

♥ 1.5k⇄ 133✎ 70原帖 ↗
@timnitGebru (@dair-community.social/bsky.social) @timnitGebru

Timnit Gebru 的新书《Deep Unlearning》开放预订。全书 18 章,试图系统展开她对 AI、知识与权力结构的长期批判。

♥ 965⇄ 304✎ 50原帖 ↗
低信号与缺口
第一类,窗口内零发帖(status=ok 且 window_post_count=0):@Red_Xiao_、@ManusAI、@AnthropicAI、@tydsh、@hugo_larochelle、@drfeifei、@srush_nlp、@soumithchintala、@OriolVinyalsML、@StanfordAILab、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@AIatMeta、@ilyasut、@seb_ruder、@kaifulee、@ylecun、@ThomasOrTK、@karpathy、@lexfridman、@elicollins、@gdb、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@IBMResearch、@MSFTResearch、@rowancheung、@ID_AA_Carmack、@geoffreyhinton、@AndrewYNg、@sama,共 35 个账号,窗口内无更新。第二类,有发帖但未选入主报告:@steipete、@OfficialLoganK、@GeminiApp、@EMostaque、@JeffDean、@GoogleAI,共 6 个账号;内容主要是简短回复、生活话题、低信息量观点,或与已选 Gemini 3.7 Flash 官方发布高度重复,属于发了但未入选。第三类,抓取失败:无,52 个账号状态均为 ok。本次主报告对关注列表严格采用 2026-08-13 08:00 至 2026-08-14 08:00(北京时间)窗口;另混编 6 条 buildernews 近一日外部信号,它们不参与关注账号和精确窗口统计。