Challen · X Following Dispatch No. 20260823

THE FOLLOWING

关注列表·北京时间24小时声音
2026-08-23 ★ 15 条 · 4 个主题 · 52 个账号 ★ COBALT GRID
编辑导言 FROM THE EDITOR

今天的信号不在又多了一个模型,而在模型竞争开始同时挤压价格、速度和可用性。Gemini 3.7 Flash 的增长、OpenAI 对任务成本下限与能力上限的表态,以及应用层创业者对智能成本持续下降的判断,共同指向一个变化:前沿能力正在更快变成可以大规模分发的基础供给。

另一条更值得展开的线索是 Agent 已经越过演示阶段,开始暴露工程系统才会有的问题。评测会被 benchmax,单一分数会掩盖关键场景退化,缓存命中会直接影响配额消耗,安全 Agent 也需要可审计的扫描结果和清晰的责任边界。行业关注点正从 Agent 能不能做,转向它能否被可靠地评估、部署和约束。

覆盖 52/52 个关注账号 · 15 条入选 · 聚为 4 个主题 · 由 AI 实时归纳,仅供参考
§ 第 Ⅰ 章 §
◆

模型竞争转向性价比

共 4 条

能力竞赛之外,价格、速度和规模化分发正在成为模型竞争的同一张成绩单。

Sundar Pichai @sundarpichai

Gemini 3.7 Flash 上线首周打破历代 Gemini 的增长纪录,成为增长最快的 Gemini 模型,并已进入 Search 与 Gemini app。

♥ 3.2k⇄ 243✎ 232原帖 ↗
Greg Brockman @gdb

OpenAI 的目标是让客户在各类任务上获得市场最低价格,同时保留最高的能力上限。

♥ 1.0k⇄ 38✎ 88原帖 ↗
Bindu Reddy @bindureddy

她认为 Gemini 3.7 Flash 已是同档强模型,并对传闻中的 Gemini 4.0 Pro 持乐观预期,判断其有机会超过 Fable 与 Sol。

♥ 481⇄ 13✎ 56原帖 ↗
Aaron Levie @levie

模型在同类任务上持续降价,同时变得更通用、更快并深入更多领域。下一阶段的机会,是把越来越便宜的智能扩散到真实经济活动中。

♥ 35⇄ 2✎ 11原帖 ↗
§ 第 Ⅱ 章 §
◆

Agent 评测进入深水区

共 4 条

采用速度越快,评测污染、指标失真和关键场景退化就越不能靠一个总分掩盖。

Greg Brockman @gdb

Agentic 产品的采用速度非常快,回看行业演进,很容易低估这一领域已经走了多远。

♥ 630⇄ 31✎ 67原帖 ↗
Bindu Reddy @bindureddy

LiveBench 的 agentic coding 项目容易被 benchmax,现有结果已受到针对性优化影响;团队正以更难被刷榜的 LiveBench 2.0 替换它。

♥ 2⇄ 1✎ 2原帖 ↗
Madhu Guru @realmadhuguru

复杂 eval 不应被压缩成单一总分。平均值可能遮住前沿业务场景的退化,加权总分也只是把判断包装成虚假的数学精确性。

♥ 143⇄ 11✎ 9原帖 ↗
Guillermo Rauch @rauchg

团队让 is-agentic 对目标系统循环评测直到达到 100/100,这一过程迫使他们补齐了多处能力缺口,同时强调评测标准必须真正值得消耗时间与 tokens。

♥ 1.4k⇄ 52✎ 88原帖 ↗
§ 第 Ⅲ 章 §
◆

编码助手走向日常基础设施

共 4 条

工具价值开始由配额效率、解释能力、工作流结构和本地运行能力共同决定。

Thibault Sottiaux @thsottiaux

Codex 部分用户本周的 cache hit rate 低于此前稳定水平,可能导致配额消耗加快;团队正在调查并承诺继续更新。

♥ 2.9k⇄ 132✎ 539原帖 ↗
Thariq @trq212

Anthropic 内部常用的 ELI5 skill,可把模块机制、技术取舍或事故原因生成少文字、大图示的 HTML 解释稿。

♥ 7.5k⇄ 563✎ 227原帖 ↗
Peter Yang @petergyang

Instinct 的 iMessage、Google Workspace 与 MCP 接入顺滑,也更主动推荐可执行任务,但单线程交互限制了复杂工作;他仍把 ChatGPT Work 与 Codex 作为主力生产工具。

♥ 131⇄ 4✎ 34原帖 ↗
Peter Steinberger 🦞 @steipete

团队持续开发可完全本地运行的版本,一个重要背景是小模型的能力正在明显改善。

♥ 28⇄ 0✎ 3原帖 ↗
§ 第 Ⅳ 章 §
◆

安全 Agent 需要可审计边界

共 3 条

安全自动化正在从模型能力展示转向扫描结果、修复建议与责任主体都可追踪的产品形态。

Zack Korman @ZackKorman

围绕 Mythos 诱导维护者合并恶意代码的争议出现反转:被认为是人类的维护者也疑似 AI bot,真正识别异常的反而是人类观察者。

♥ 95⇄ 8✎ 18原帖 ↗
Claude @claudeai

Claude Security 可对 GitHub repo 做跨文件数据流与组件关系分析,每项发现都返回 CWE 分类、置信度、严重性和建议修复方案。

♥ 417⇄ 19✎ 12原帖 ↗
Claude @claudeai

Anthropic 正推动合作伙伴把 Mythos 5 接入安全产品,并通过 3500 万美元 credits 支持开源安全,同时计划扩展 Cyber Verification Program。

♥ 212⇄ 3✎ 3原帖 ↗
低信号与缺口
第一类,窗口内零发帖:Red_Xiao_、ManusAI、OfficialLoganK、AnthropicAI、tydsh、hugo_larochelle、drfeifei、GeminiApp、srush_nlp、soumithchintala、OriolVinyalsML、StanfordAILab、goodfellow_ian、ShunyuYao12、NotebookLM、berkeley_ai、KrugerSays、AIatMeta、wadefoster、ilyasut、seb_ruder、EMostaque、kaifulee、ylecun、ThomasOrTK、karpathy、demishassabis、lexfridman、JeffDean、elicollins、BaiduResearch、Metamind、IntelAI、Tesla_AI、IBMResearch、MSFTResearch、GoogleDeepMind、GoogleAI、fchollet、rowancheung、ID_AA_Carmack、Yoshua_Bengio、geoffreyhinton、AndrewYNg、OpenAI、sama,共 46 个账号。第二类,有发帖但未选入主报告:timnitGebru,共 1 个账号;其窗口内帖子与本期 AI 产品、模型和 Agent 主线关联较弱,因此发了但未入选,不能视为无更新。第三类,抓取失败:无。窗口说明:本次覆盖 2026-08-22 08:00 至 2026-08-23 08:00(北京时间),52 个关注账号全部抓取成功,窗口内共 14 条 raw 帖,属于低信号日;buildernews 仅作为近一日外部信号补充,不计入关注账号缺口统计。