Bindu 预告新一轮模型发布会重新加速,最关注 Grok 4.6、GLM 5.5 和 DeepSeek v4 Pro,并认为定价会决定采用速度。
X 日报个人阅读
2026 年 8 月 13 日 · 周四
2026-08-12 08:00 至 2026-08-13 08:00(北京时间)
关注账号覆盖
条入选
个主题
晨间播报
开车或走路时直接听;会记住播放速度和上次听到的位置。下载 MP3
编辑导言
今天最清楚的信号不是又一份榜单,而是两款模型同一窗口落地,产品入口也在同一天被改写。Grok 4.6 按 4.5 的价格放出,DeepSeek v4 Pro 被看成接近 Sonnet 档的可上线开源模型;定价和能不能进生产,比再刷一次分数更决定采用。Google 则把 Gemini 写进 Pixel 11 的日常动作:语音输入、拍照、来电提示,再加上美国手语直接进入 Gboard 和 Live Transcribe。
另一条更稳的线索来自 builders。生产级 Agent 的失败形态已经从 off-by-one 变成系统设计、界面和上下文缺失;企业落地仍然依赖 FDE 去改流程、补 eval、跟上模型更新。Claude 开始给生成文本加水印,说明可识别性正在变成合规前置,而不是事后装饰。模型变快了,把它们接进真实工作流的成本没有消失。
01新模型同日撞车
Grok 4.6 与 DeepSeek v4 Pro 挤进同一窗口,价格和可上线性开始压过单纯刷榜。
Grok 4.6 已上线,即将进入 LiveBench。价格与 Grok 4.5 持平,但相对 4.5 的实际提升仍待评测,不宜把发布本身当成代际跳跃。
DeepSeek v4 Pro 公布后,Bindu 认为其纸面成绩有刷榜成分,但生产可用性仍在,并把它放在 Sonnet 档。开源模型供给正在明显变密。
Emad 把 GDPVal 看成最重要的真实任务基准,并祝贺 SpaceXAI 团队以更好价格登顶。这是对 Grok 4.6 工作能力的背书,不是对所有榜单的背书。
02Pixel 把 Gemini 做成入口
Google 用硬件、输入法和手语翻译,把 Gemini 从聊天窗口推进到手机上的连续动作。
Pixel 11 系列发布,主打 Gemini Intelligence。Sundar 点名 Rambler 语音输入、Magic Capture 拍照,以及手机朝下时用 HiLight 提示重要来电。
SL2T 把手语转成文字,先在 Pixel 11 上支持美国手语到英语,可直接签入 Gboard 和 Live Transcribe,服务听障用户。
Sundar 把 Gboard 与 Live Transcribe 的手语转文字称为 Made by Google 当天最重要更新之一,并强调与听障社区共同打磨。
Gemini 新增 14 个可连接应用,覆盖订餐、票务、音乐、建站、会议纪要和本地服务。产品方向是把待办留在一个入口里完成,而不只是回答问题。
03生产工程的真实约束
推荐系统延迟、研究算力浪费和 Agent 产品形态,把能力讨论拉回成本和边界。
Expedia 把排序模型迁到 Keras 3 后,训练加快 30%,推理延迟下降 70%。这是大规模推荐系统用新框架换吞吐的实锤,不是框架宣传稿。
Carmack 对 Keen 研究员的算力建议是:想象每轮实验都在烧一叠百元钞票,再拿它去换所求的知识。研究把钱变成洞察比以前更容易,也仍然容易浪费。
MindTopo 用路径、围栏和绳结测试模型对拓扑关系的理解,目标是补空间推理和规划短板,而不是再做一套常规视觉识别榜。
Peter 把过去一年的产品迁移压缩成一句:一年前是 CLI,大约半年前是 App,现在轮到服务、Web 和云端 session。Agent 产品正在离开本地命令行。
04Agent 交付仍靠人和流程
模型能写代码之后,真正卡住的是评测、客户流程改造和产品入口清理。
Boris 认为 LLM 仍会制造 bug,但形态已从 off-by-one 转向系统设计、界面和缺失的更大上下文。对抗式 code review,包括 Claude 内置 /code-review,是当前最有效的拦截层。
Levie 认为 FDE 不会很快消失:AI Agent 要把非确定性系统塞进从未被自动化过的流程,需要持续改客户流程、补 eval、跟模型更新。这和传统软件一次性实施不是同类工作。
Thibault 曾承诺 Codex 每增加 100 万活跃用户就重置一次额度,直到 1000 万。现在已经越过 1000 万却没有兑现,他预告次日会有惊喜。
05安全先变成可识别
未受约束的竞赛仍被点名,生成文本水印则把合规从口号落成可检查的工具。
Bengio 转发 Tristan Harris 的讨论,强调无监管的 AI 竞赛会伤害所有人,需要更多国际协作、安全标准和公共参与。这是治理呼吁,不是新的技术结果。
Anthropic 将给所有 Claude 生成文本嵌入水印,并配合欧盟 AI Act。实验室会提供文本检测 API,但也承认识别 AI 文本仍有局限。
低信号与抓取缺口
第一类,窗口内零发帖:Red_Xiao_、ManusAI、OfficialLoganK、AnthropicAI、tydsh、hugo_larochelle、drfeifei、srush_nlp、soumithchintala、OriolVinyalsML、StanfordAILab、goodfellow_ian、ShunyuYao12、NotebookLM、berkeley_ai、AIatMeta、wadefoster、ilyasut、seb_ruder、kaifulee、ylecun、ThomasOrTK、karpathy、demishassabis、elicollins、gdb、BaiduResearch、Metamind、IntelAI、Tesla_AI、IBMResearch、GoogleAI、rowancheung、geoffreyhinton、AndrewYNg、OpenAI、sama,共 37 个账号,审计显示 status=ok 且 window_post_count=0,可确认窗口内无更新。第二类,有发帖但未选入主报告:ZackKorman、KrugerSays、timnitGebru、lexfridman、JeffDean,共 5 个账号;这些账号发了内容,但主要是短回复、个人叙事、播客宣传或与本期主线关联较弱,因此发了但未入选,不能视为无更新。GeminiApp 的 14 个应用线程只保留了总述帖,其余分条未单列。第三类,抓取失败:无,52 个账号均抓取成功。本次统计窗口为 2026-08-12 08:00 至 2026-08-13 08:00(北京时间);关注列表窗口内共 43 条 raw 帖,buildernews 仅作为近一日外部信号补充,不计入关注账号缺口统计。