今天最清楚的信号不是又一份榜单,而是两款模型同一窗口落地,产品入口也在同一天被改写。Grok 4.6 按 4.5 的价格放出,DeepSeek v4 Pro 被看成接近 Sonnet 档的可上线开源模型;定价和能不能进生产,比再刷一次分数更决定采用。Google 则把 Gemini 写进 Pixel 11 的日常动作:语音输入、拍照、来电提示,再加上美国手语直接进入 Gboard 和 Live Transcribe。
另一条更稳的线索来自 builders。生产级 Agent 的失败形态已经从 off-by-one 变成系统设计、界面和上下文缺失;企业落地仍然依赖 FDE 去改流程、补 eval、跟上模型更新。Claude 开始给生成文本加水印,说明可识别性正在变成合规前置,而不是事后装饰。模型变快了,把它们接进真实工作流的成本没有消失。
Grok 4.6 与 DeepSeek v4 Pro 挤进同一窗口,价格和可上线性开始压过单纯刷榜。
Bindu 预告新一轮模型发布会重新加速,最关注 Grok 4.6、GLM 5.5 和 DeepSeek v4 Pro,并认为定价会决定采用速度。
Grok 4.6 已上线,即将进入 LiveBench。价格与 Grok 4.5 持平,但相对 4.5 的实际提升仍待评测,不宜把发布本身当成代际跳跃。
DeepSeek v4 Pro 公布后,Bindu 认为其纸面成绩有刷榜成分,但生产可用性仍在,并把它放在 Sonnet 档。开源模型供给正在明显变密。
Emad 把 GDPVal 看成最重要的真实任务基准,并祝贺 SpaceXAI 团队以更好价格登顶。这是对 Grok 4.6 工作能力的背书,不是对所有榜单的背书。
Google 用硬件、输入法和手语翻译,把 Gemini 从聊天窗口推进到手机上的连续动作。
Pixel 11 系列发布,主打 Gemini Intelligence。Sundar 点名 Rambler 语音输入、Magic Capture 拍照,以及手机朝下时用 HiLight 提示重要来电。
SL2T 把手语转成文字,先在 Pixel 11 上支持美国手语到英语,可直接签入 Gboard 和 Live Transcribe,服务听障用户。
Sundar 把 Gboard 与 Live Transcribe 的手语转文字称为 Made by Google 当天最重要更新之一,并强调与听障社区共同打磨。
Gemini 新增 14 个可连接应用,覆盖订餐、票务、音乐、建站、会议纪要和本地服务。产品方向是把待办留在一个入口里完成,而不只是回答问题。
推荐系统延迟、研究算力浪费和 Agent 产品形态,把能力讨论拉回成本和边界。
Expedia 把排序模型迁到 Keras 3 后,训练加快 30%,推理延迟下降 70%。这是大规模推荐系统用新框架换吞吐的实锤,不是框架宣传稿。
Carmack 对 Keen 研究员的算力建议是:想象每轮实验都在烧一叠百元钞票,再拿它去换所求的知识。研究把钱变成洞察比以前更容易,也仍然容易浪费。
MindTopo 用路径、围栏和绳结测试模型对拓扑关系的理解,目标是补空间推理和规划短板,而不是再做一套常规视觉识别榜。
Peter 把过去一年的产品迁移压缩成一句:一年前是 CLI,大约半年前是 App,现在轮到服务、Web 和云端 session。Agent 产品正在离开本地命令行。
模型能写代码之后,真正卡住的是评测、客户流程改造和产品入口清理。
Boris 认为 LLM 仍会制造 bug,但形态已从 off-by-one 转向系统设计、界面和缺失的更大上下文。对抗式 code review,包括 Claude 内置 /code-review,是当前最有效的拦截层。
Levie 认为 FDE 不会很快消失:AI Agent 要把非确定性系统塞进从未被自动化过的流程,需要持续改客户流程、补 eval、跟模型更新。这和传统软件一次性实施不是同类工作。
Thibault 曾承诺 Codex 每增加 100 万活跃用户就重置一次额度,直到 1000 万。现在已经越过 1000 万却没有兑现,他预告次日会有惊喜。
未受约束的竞赛仍被点名,生成文本水印则把合规从口号落成可检查的工具。