Challen · X Following Dispatch No. 20260813

THE FOLLOWING

关注列表·北京时间24小时声音
2026-08-13 ★ 17 条 · 5 个主题 · 52 个账号 ★ COBALT GRID
编辑导言 FROM THE EDITOR

今天最清楚的信号不是又一份榜单,而是两款模型同一窗口落地,产品入口也在同一天被改写。Grok 4.6 按 4.5 的价格放出,DeepSeek v4 Pro 被看成接近 Sonnet 档的可上线开源模型;定价和能不能进生产,比再刷一次分数更决定采用。Google 则把 Gemini 写进 Pixel 11 的日常动作:语音输入、拍照、来电提示,再加上美国手语直接进入 Gboard 和 Live Transcribe。

另一条更稳的线索来自 builders。生产级 Agent 的失败形态已经从 off-by-one 变成系统设计、界面和上下文缺失;企业落地仍然依赖 FDE 去改流程、补 eval、跟上模型更新。Claude 开始给生成文本加水印,说明可识别性正在变成合规前置,而不是事后装饰。模型变快了,把它们接进真实工作流的成本没有消失。

覆盖 52/52 个关注账号 · 17 条入选 · 聚为 5 个主题 · 由 AI 实时归纳,仅供参考
§ 第 Ⅰ 章 §
◆

新模型同日撞车

共 4 条

Grok 4.6 与 DeepSeek v4 Pro 挤进同一窗口,价格和可上线性开始压过单纯刷榜。

Bindu Reddy @bindureddy

Bindu 预告新一轮模型发布会重新加速,最关注 Grok 4.6、GLM 5.5 和 DeepSeek v4 Pro,并认为定价会决定采用速度。

♥ 187⇄ 4✎ 27原帖 ↗
Bindu Reddy @bindureddy

Grok 4.6 已上线,即将进入 LiveBench。价格与 Grok 4.5 持平,但相对 4.5 的实际提升仍待评测,不宜把发布本身当成代际跳跃。

♥ 119⇄ 3✎ 13原帖 ↗
Bindu Reddy @bindureddy

DeepSeek v4 Pro 公布后,Bindu 认为其纸面成绩有刷榜成分,但生产可用性仍在,并把它放在 Sonnet 档。开源模型供给正在明显变密。

♥ 105⇄ 8✎ 9原帖 ↗
Emad @EMostaque

Emad 把 GDPVal 看成最重要的真实任务基准,并祝贺 SpaceXAI 团队以更好价格登顶。这是对 Grok 4.6 工作能力的背书,不是对所有榜单的背书。

♥ 325⇄ 34✎ 23原帖 ↗
§ 第 Ⅱ 章 §
◇

Pixel 把 Gemini 做成入口

共 4 条

Google 用硬件、输入法和手语翻译,把 Gemini 从聊天窗口推进到手机上的连续动作。

Sundar Pichai @sundarpichai

Pixel 11 系列发布,主打 Gemini Intelligence。Sundar 点名 Rambler 语音输入、Magic Capture 拍照,以及手机朝下时用 HiLight 提示重要来电。

♥ 1.5k⇄ 114✎ 109原帖 ↗
Google DeepMind @GoogleDeepMind

SL2T 把手语转成文字,先在 Pixel 11 上支持美国手语到英语,可直接签入 Gboard 和 Live Transcribe,服务听障用户。

♥ 1.1k⇄ 152✎ 74原帖 ↗
Sundar Pichai @sundarpichai

Sundar 把 Gboard 与 Live Transcribe 的手语转文字称为 Made by Google 当天最重要更新之一,并强调与听障社区共同打磨。

♥ 2.0k⇄ 193✎ 123原帖 ↗
Google Gemini @GeminiApp

Gemini 新增 14 个可连接应用,覆盖订餐、票务、音乐、建站、会议纪要和本地服务。产品方向是把待办留在一个入口里完成,而不只是回答问题。

♥ 1.1k⇄ 104✎ 88原帖 ↗
§ 第 Ⅲ 章 §
▣

生产工程的真实约束

共 4 条

推荐系统延迟、研究算力浪费和 Agent 产品形态,把能力讨论拉回成本和边界。

François Chollet @fchollet

Expedia 把排序模型迁到 Keras 3 后,训练加快 30%,推理延迟下降 70%。这是大规模推荐系统用新框架换吞吐的实锤,不是框架宣传稿。

♥ 109⇄ 9✎ 18原帖 ↗
John Carmack @ID_AA_Carmack

Carmack 对 Keen 研究员的算力建议是:想象每轮实验都在烧一叠百元钞票,再拿它去换所求的知识。研究把钱变成洞察比以前更容易,也仍然容易浪费。

♥ 655⇄ 33✎ 32原帖 ↗
Microsoft Research @MSFTResearch

MindTopo 用路径、围栏和绳结测试模型对拓扑关系的理解,目标是补空间推理和规划短板,而不是再做一套常规视觉识别榜。

♥ 38⇄ 5✎ 1原帖 ↗
Peter Steinberger @steipete

Peter 把过去一年的产品迁移压缩成一句:一年前是 CLI,大约半年前是 App,现在轮到服务、Web 和云端 session。Agent 产品正在离开本地命令行。

♥ 916⇄ 29✎ 68原帖 ↗
§ 第 Ⅳ 章 §
▲

Agent 交付仍靠人和流程

共 3 条

模型能写代码之后,真正卡住的是评测、客户流程改造和产品入口清理。

Boris Cherny @bcherny

Boris 认为 LLM 仍会制造 bug,但形态已从 off-by-one 转向系统设计、界面和缺失的更大上下文。对抗式 code review,包括 Claude 内置 /code-review,是当前最有效的拦截层。

♥ 2.4k⇄ 127✎ 161原帖 ↗
Aaron Levie @levie

Levie 认为 FDE 不会很快消失:AI Agent 要把非确定性系统塞进从未被自动化过的流程,需要持续改客户流程、补 eval、跟模型更新。这和传统软件一次性实施不是同类工作。

♥ 88⇄ 9✎ 20原帖 ↗
Thibault Sottiaux @thsottiaux

Thibault 曾承诺 Codex 每增加 100 万活跃用户就重置一次额度,直到 1000 万。现在已经越过 1000 万却没有兑现,他预告次日会有惊喜。

♥ 2.7k⇄ 176✎ 516原帖 ↗
§ 第 Ⅴ 章 §
○

安全先变成可识别

共 2 条

未受约束的竞赛仍被点名,生成文本水印则把合规从口号落成可检查的工具。

Yoshua Bengio @Yoshua_Bengio

Bengio 转发 Tristan Harris 的讨论,强调无监管的 AI 竞赛会伤害所有人,需要更多国际协作、安全标准和公共参与。这是治理呼吁,不是新的技术结果。

♥ 65⇄ 10✎ 4原帖 ↗
Thariq @trq212

Anthropic 将给所有 Claude 生成文本嵌入水印,并配合欧盟 AI Act。实验室会提供文本检测 API,但也承认识别 AI 文本仍有局限。

♥ 946⇄ 46✎ 466原帖 ↗
低信号与缺口
第一类,窗口内零发帖:Red_Xiao_、ManusAI、OfficialLoganK、AnthropicAI、tydsh、hugo_larochelle、drfeifei、srush_nlp、soumithchintala、OriolVinyalsML、StanfordAILab、goodfellow_ian、ShunyuYao12、NotebookLM、berkeley_ai、AIatMeta、wadefoster、ilyasut、seb_ruder、kaifulee、ylecun、ThomasOrTK、karpathy、demishassabis、elicollins、gdb、BaiduResearch、Metamind、IntelAI、Tesla_AI、IBMResearch、GoogleAI、rowancheung、geoffreyhinton、AndrewYNg、OpenAI、sama,共 37 个账号,审计显示 status=ok 且 window_post_count=0,可确认窗口内无更新。第二类,有发帖但未选入主报告:ZackKorman、KrugerSays、timnitGebru、lexfridman、JeffDean,共 5 个账号;这些账号发了内容,但主要是短回复、个人叙事、播客宣传或与本期主线关联较弱,因此发了但未入选,不能视为无更新。GeminiApp 的 14 个应用线程只保留了总述帖,其余分条未单列。第三类,抓取失败:无,52 个账号均抓取成功。本次统计窗口为 2026-08-12 08:00 至 2026-08-13 08:00(北京时间);关注列表窗口内共 43 条 raw 帖,buildernews 仅作为近一日外部信号补充,不计入关注账号缺口统计。