X 日报个人阅读

2026 年 8 月 14 日 · 周五

2026-08-13 08:00 至 2026-08-14 08:00(北京时间)

52/52

关注账号覆盖

23

条入选

5

个主题

晨间播报

开车或走路时直接听;会记住播放速度和上次听到的位置。下载 MP3

编辑导言

今天的主旋律不是又多了几个模型名字,而是前沿能力正在被重新定价。OpenAI 用 Ultrafast 把 GPT-5.6 Sol 推到每秒最高 750 tokens,Google 则让 Gemini 3.7 Flash 在提价极小的情况下跨过 AutomationBench 30% 的门槛。模型竞争正从跑分榜走进真实工作流,速度、单任务成本和完整通过率开始比一句“更聪明”更有分量。

另一条线索更值得长期追踪:Agent 正从聊天框向操作系统和企业流程扩张。Computer History、跨设备 Claude 会话、Gemini 的应用连接,以及企业对 skills 和模型路由的使用,都在争夺同一件东西:谁能持续理解上下文,并把意图稳定变成动作。能力供给快速商品化后,真正的差异将落在工作流理解、可信执行和安全边界上。

01模型进入效率战

速度、价格与真实任务通过率同时成为模型竞争的新坐标。

OpenAI@OpenAI

OpenAI 预览 GPT-5.6 Sol 的 Ultrafast 模式,最高可达原速度的 14 倍,先向部分 API 客户开放。

赞 10.9k转 667评 533原帖 ↗
OpenAI@OpenAI

Ultrafast 由 Cerebras 提供算力,生成速度最高 750 tokens/s,目标场景包括实时语音、客服、编程、金融研究与安全响应。

赞 1.4k转 55评 15原帖 ↗
Google DeepMind@GoogleDeepMind

Google DeepMind 发布 Gemini 3.7 Flash,重点提升 coding、knowledge work 与 web development 能力。

赞 3.2k转 396评 213原帖 ↗
Sundar Pichai@sundarpichai

Gemini 3.7 Flash 距 3.6 发布仅三周,强化软件工程、Agent 任务与知识工作,限时价格降至 3.6 Flash 原价的一半。

赞 2.9k转 255评 245原帖 ↗
Wade Foster@wadefoster

Zapier 的 657 项确定性工作流测试显示,Gemini 3.7 Flash 以接近原成本首次突破 AutomationBench 30%,营销、金融和销售表现突出,但 Operations 仍落后于 Opus 5。

赞 77转 10评 3原帖 ↗
Bindu Reddy@bindureddy

Bindu Reddy 的首日判断是 Grok 4.6 已到 Sonnet 级可用区间,价格有吸引力,并开始承接部分原 Sonnet 工作负载。

赞 286转 7评 46原帖 ↗

02企业落地转向编排

模型变多变便宜之后,企业优势取决于 skills、路由与实施能力。

OpenAI@OpenAI

OpenAI 的企业观察显示,领先 10% 的企业使用 plugins 的频率是普通企业的 2 倍,使用 skills 的频率达到 6 倍,差距来自组织化调用能力而非偶然尝试。

赞 3.0k转 140评 138原帖 ↗
Bindu Reddy@bindureddy

多模型自改进循环的核心是按成本和性能为任务选模型,再用目标与指标驱动长程自动化,而不是把所有任务押在单一模型上。

赞 308转 19评 42原帖 ↗
Aaron Levie@levie外部信号

DeepSeek 与 Grok 的低成本跃升会触发 AI 版 Jevons paradox:单次调用更便宜,企业反而会把更多代码、文档和流程交给 Agent,也提升应用层模型路由的价值。

赞 212转 13评 21原帖 ↗
Madhu Guru@realmadhuguru外部信号

随着模型持续降价、增强并走向本地化,AI 产品的主要增量将转向应用层:深入理解具体工作流,并据此重做用户体验。

赞 178转 12评 22原帖 ↗
Alex Kruger@KrugerSays

一个简短但明确的组织信号:下一位关键招聘应是 AI Implementation Specialist,负责把模型能力落进真实业务。

赞 2转 0评 0原帖 ↗

03Agent争夺上下文

跨设备记忆、电脑活动与应用连接正在成为个人 Agent 的新入口。

OpenAI@OpenAI

ChatGPT 桌面端推出 Computer History,可记住电脑上应用与网站活动,让后续对话减少重复说明并获得更连续的个人上下文。

赞 5.8k转 413评 332原帖 ↗
OpenAI@OpenAI

Computer History 增加时间线、应用和网站排除、局部清除及暂停能力,并降低 token 消耗,显示长期记忆产品必须把可控性与隐私一起交付。

赞 560转 12评 16原帖 ↗
Claude@claudeai外部信号

Claude in Chrome 的会话、skills 与 connectors 可延续到桌面、Web 和移动端,Agent 状态开始归属于账号,而不是被锁在单一设备。

赞 8.5k转 615评 382原帖 ↗
Josh Woodward@joshwoodward外部信号

Gemini 新一轮接入 OpenTable、Ticketmaster、Wix、Zocdoc、Zoho 等服务,继续把通用助手变成跨应用执行层。

赞 241转 11评 20原帖 ↗
Peter Yang@petergyang外部信号

Peter Yang 判断人机交互将从键鼠操作转向用语音编排云端 Agent,个人电脑也会逐渐云化,而信任将成为产品分水岭。

赞 90转 11评 14原帖 ↗

04推理与安全同场

更强的测试时学习与长程行动能力,也要求更严格的诚实性和攻击面治理。

François Chollet@fchollet

Chollet 认为 test-time training 在 ARC Prize 2024 后得到验证,目前 ARC 1-2 仍是其显著领先的少数数据集,但这条路线值得进入主流研究。

赞 206转 12评 17原帖 ↗
François Chollet@fchollet

当前 test-time compute 多用于自然语言搜索与 verifier 循环;另一条路是测试时直接利用梯度训练,价值高但工程成本也更大。

赞 22转 1评 3原帖 ↗
Yoshua Bengio@Yoshua_Bengio

Bengio 警告前沿模型可能出现类似人类的 motivated reasoning,在目标冲突时重构事实为行动辩护,因此训练中的诚实性与内部信念一致性应成为核心约束。

赞 72转 12评 3原帖 ↗
Claude@claudeai外部信号

Claude 提醒浏览器 Agent 会受到网页隐藏指令诱导。平台虽已部署防御,用户侧仍需保持授权与操作习惯上的防线。

赞 245转 3评 7原帖 ↗
Zack Korman@ZackKorman

Korman 认为 AI 不会只单向降低网络攻击门槛,国家授权的反制与威慑也会同步增强,医院和电网遭到无成本滥攻的情形未必如想象中普遍。

赞 185转 17评 22原帖 ↗

05技术回到人的尺度

AI 的价值和批判都必须落到具体人群、具体能力与具体权力关系上。

Demis Hassabis@demishassabis

Google 推出 SL2T 手语转文字模型,让用户首次可直接对手机打手语;产品与 Deaf community 共同开发,体现可及性场景中的协作式 AI。

赞 1.5k转 133评 70原帖 ↗
@timnitGebru (@dair-community.social/bsky.social)@timnitGebru

Timnit Gebru 的新书《Deep Unlearning》开放预订。全书 18 章,试图系统展开她对 AI、知识与权力结构的长期批判。

赞 965转 304评 50原帖 ↗
低信号与抓取缺口

第一类,窗口内零发帖(status=ok 且 window_post_count=0):@Red_Xiao_、@ManusAI、@AnthropicAI、@tydsh、@hugo_larochelle、@drfeifei、@srush_nlp、@soumithchintala、@OriolVinyalsML、@StanfordAILab、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@AIatMeta、@ilyasut、@seb_ruder、@kaifulee、@ylecun、@ThomasOrTK、@karpathy、@lexfridman、@elicollins、@gdb、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@IBMResearch、@MSFTResearch、@rowancheung、@ID_AA_Carmack、@geoffreyhinton、@AndrewYNg、@sama,共 35 个账号,窗口内无更新。第二类,有发帖但未选入主报告:@steipete、@OfficialLoganK、@GeminiApp、@EMostaque、@JeffDean、@GoogleAI,共 6 个账号;内容主要是简短回复、生活话题、低信息量观点,或与已选 Gemini 3.7 Flash 官方发布高度重复,属于发了但未入选。第三类,抓取失败:无,52 个账号状态均为 ok。本次主报告对关注列表严格采用 2026-08-13 08:00 至 2026-08-14 08:00(北京时间)窗口;另混编 6 条 buildernews 近一日外部信号,它们不参与关注账号和精确窗口统计。