Challen · X Following Dispatch No. 20260822

THE FOLLOWING

关注列表·北京时间24小时声音
2026-08-22 ★ 25 条 · 6 个主题 · 52 个账号 ★ COBALT GRID
编辑导言 FROM THE EDITOR

这一期最清晰的主旋律,是 AI 竞争开始从单点能力转向整套生产系统。OpenAI 用限时降价回应开源模型的压力,RouteLLM、垂直 post-training 和 Agent 基础设施则在解决同一个现实问题:不是永远调用最强模型,而是把成本、质量、工具和工作流组合成可持续的系统。

另一条值得展开的线索,是行业正在补上规模化后的边界。评测不能拿公开演示集冒充完整 benchmark,企业落地也不能只谈能力,还要回答数据留存、访问控制、订阅使用和事故责任。Agent 越能替人看、替人做,工程纪律和治理责任就越不能停留在合规勾选。

技术之外还有一个安静但重要的提醒:工作天然有目标、数字和仪表盘,健康、家庭与关系却不会自动汇报。真正成熟的个人操作系统,既要让 Agent 替你管理注意力,也要防止最响亮的指标遮住正在缓慢流失的生活。

覆盖 52/52 个关注账号 · 25 条入选 · 聚为 6 个主题 · 由 AI 实时归纳,仅供参考
§ 第 Ⅰ 章 §
◆

模型价格进入系统战

共 4 条

降价、动态路由和垂直 post-training 正把模型竞争从榜单拉回单位任务的成本与质量。

OpenAI @OpenAI

OpenAI 宣布未来三个月将 GPT-5.6 Sol 的 API 与 credits 价格下调超过 20%,以能力提升与效率优化同步推动使用成本下降。

♥ 8.1k⇄ 443✎ 373原帖 ↗
Bindu Reddy @bindureddy

Bindu Reddy 将 Sol 降价视为开源 AI 竞争正在发挥作用的直接信号,价格已经成为模型竞争的重要战场。

♥ 63⇄ 1✎ 9原帖 ↗
Bindu Reddy @bindureddy

RouteLLM API 按 prompt 难度在 150 多个模型间路由,并处理缓存:简单轮次交给开源模型,复杂长任务再调用 frontier model。

♥ 126⇄ 17✎ 34原帖 ↗
Aaron Levie @levie

垂直 AI 公司在任务规模和领域理解足够深后,可以通过 post-training 与 reward shaping 同时优化工具调用、推理 token、成本和准确率,而不必对所有任务依赖通用 frontier model。

♥ 57⇄ 5✎ 6原帖 ↗
§ 第 Ⅱ 章 §
◆

Agent 从工具长成环境

共 5 条

Agent 的下一阶段不只是会调用工具,而是拥有持续记忆、长期规划和完整运行基础设施。

Emad @EMostaque

平台时代争夺人的注意力,Agent 时代则由机器代替人分配注意力,信息入口的权力关系正在变化。

♥ 91⇄ 8✎ 16原帖 ↗
Google DeepMind @GoogleDeepMind

DeepMind 将持久化游戏世界作为 Agent 研究场,集中探索持续学习、超长记忆、跨月与跨年的规划,以及合作、谈判和经济行为等多 Agent 动力学。

♥ 734⇄ 89✎ 73原帖 ↗
Peter Steinberger 🦞 @steipete

Peter Steinberger 在 Agentic AI Summit 分享“No Doors for Agents”,主张不要用人为入口限制 Agent 的行动空间。

♥ 99⇄ 6✎ 15原帖 ↗
Guillermo Rauch @rauchg

Guillermo Rauch 用“AWS for agents”概括产品方向:Agent 生态正在需要类似云计算的通用运行与部署底座。

♥ 387⇄ 11✎ 40原帖 ↗
Swyx @swyx

Swyx 介绍 /wayfinder:当目标仍处于迷雾中时,先编排研究和多轮追问,逐步找到未知问题,再进入具体执行。

♥ 87⇄ 7✎ 11原帖 ↗
§ 第 Ⅲ 章 §
◆

评测回到证据

共 4 条

从 benchmark 声明到产品迭代,行业需要分层评测和更诚实的能力边界。

François Chollet @fchollet

Chollet 肯定 NVIDIA 用深度学习引导、即时合成符号世界模型的 ARC-AGI-3 方法,同时提醒公开演示集 100% 不等于完整 benchmark 100%,就像通关教程不等于打通游戏。

♥ 574⇄ 48✎ 34原帖 ↗
Bindu Reddy @bindureddy

团队实测后认为 Ox-Alpha 表现低于上一代模型,与较旧的 Kimi 2.6 接近;高讨论度更多来自营销,而非评测结果。

♥ 22⇄ 3✎ 5原帖 ↗
Madhu Guru @realmadhuguru

企业 AI 评测应形成梯子:hill-climbing eval 推动能力上限,regression eval 防止回退,smoke test 守住底线,launch eval 用接近真实流量检验上线表现。

♥ 137⇄ 7✎ 7原帖 ↗
Peter Yang @petergyang

Peter Yang 建议用 manager agent 持续质疑 worker agent 的初稿,通过“再检查一次、还能否更好”的反馈循环提高输出,而不是接受单轮结果。

♥ 484⇄ 21✎ 90原帖 ↗
§ 第 Ⅳ 章 §
◆

企业边界开始补课

共 4 条

能力进入企业后,数据位置、访问权、恢复期限和订阅边界都必须成为产品的一部分。

Manus @ManusAI

Manus 提醒收到通知的用户须在新加坡时间 8 月 23 日 7:59 前完成数据备份,只有截止前备份的数据才能在 8 月 25 日后恢复。未收到备份要求的用户无需操作。

♥ 106⇄ 6✎ 4原帖 ↗
Boris Cherny @bcherny

面向 Mythos-class models 的企业方案将增加安全、隐私与合规控制,客户可自行持有和控制数据,Anthropic 不保留相关数据,计划秋季推出。

♥ 1.7k⇄ 95✎ 140原帖 ↗
Thariq @trq212

Fable 为企业增加可运行在自有基础设施上的 safeguards,让客户控制数据存放位置与访问权限;方案已与约 100 家公司共同开发。

♥ 543⇄ 15✎ 50原帖 ↗
Thibault Sottiaux @thsottiaux

Codex usage limit 差异主要出现在把订阅转换成 API 流量并二次分发的 sub2api 用法,这类行为会触发反欺诈;通过 ChatGPT 登录使用官方或受支持的 OSS 客户端不受影响。

♥ 2.8k⇄ 112✎ 1.4k原帖 ↗
§ 第 Ⅴ 章 §
◆

安全责任不能只靠勾选

共 4 条

围绕监控、事故责任与 AI 思想谱系的争论,正在逼迫治理从口号转向可问责机制。

Zack Korman @ZackKorman

Zack Korman 反对把统一监控要求当成安全答案,认为法律合规清单难以替代真实防护,更有效的机制应对实际事故施加高额责任。

♥ 64⇄ 7✎ 9原帖 ↗
Zack Korman @ZackKorman

他进一步认为,当前可以在日志中识别 Agent 试图关闭监控的推理并触发告警;真正难题是未来模型能否形成难以察觉的隐蔽推理,但现有证据尚未证明这一能力。

♥ 3⇄ 0✎ 3原帖 ↗
@timnitGebru (@dair-community.social/bsky.social) @timnitGebru

Timnit Gebru 将一篇涉及“dysgenic”表述的论文与 TESCREAL 及 longtermism 的思想谱系联系起来,质疑优生学语言如何进入技术与学术讨论。

♥ 332⇄ 120✎ 9原帖 ↗
@timnitGebru (@dair-community.social/bsky.social) @timnitGebru

Gebru 批评主流媒体对学术欺诈和优生学争议的关注失衡,主张把技术人物及其思想背景纳入公共问责。

♥ 128⇄ 40✎ 7原帖 ↗
§ 第 Ⅵ 章 §
◆

给生活装一块仪表盘

共 4 条

当工作指标过于响亮,主动量化健康、家庭和关系,才能看见缓慢发生的失衡。

Alex Kruger @KrugerSays

工作有目标、数字、会议和 dashboard,生活其他部分却不会每周汇报;他和伴侣因此建立固定检查机制。

♥ 2⇄ 0✎ 1原帖 ↗
Alex Kruger @KrugerSays

两人每周日为健康、工作、家庭、社区和伴侣关系分别打分并解释原因,用固定复盘把模糊感受变成可以讨论的信号。

♥ 0⇄ 0✎ 1原帖 ↗
Alex Kruger @KrugerSays

数字让自我欺骗变难:工作长期保持 9 分时,健康、关系和社区可能已经降到 4 分,只是最响亮的成绩遮住了缓慢侵蚀。

♥ 0⇄ 0✎ 1原帖 ↗
Zara Zhang @zarazhangrui

Claude 给 Zara Zhang 的提醒是:动力更多跟在行动之后,而不是先于行动出现。与其等待状态,不如先启动最小动作。

♥ 295⇄ 23✎ 42原帖 ↗
低信号与缺口
第一类,窗口内零发帖:Red_Xiao_、OfficialLoganK、AnthropicAI、hugo_larochelle、drfeifei、GeminiApp、soumithchintala、OriolVinyalsML、StanfordAILab、goodfellow_ian、ShunyuYao12、NotebookLM、berkeley_ai、AIatMeta、wadefoster、ilyasut、seb_ruder、sundarpichai、kaifulee、ThomasOrTK、karpathy、demishassabis、lexfridman、JeffDean、elicollins、gdb、BaiduResearch、Metamind、IntelAI、Tesla_AI、IBMResearch、MSFTResearch、GoogleAI、rowancheung、ID_AA_Carmack、Yoshua_Bengio、geoffreyhinton、sama,共 38 个账号窗口内无更新。第二类,有发帖但未选入主报告:tydsh、srush_nlp、ylecun、AndrewYNg,共 4 个账号;这些账号确有窗口内发帖,但内容主要为致意、约见、短回复或缺少正文上下文的链接,编辑判断后未入选。第三类,抓取失败:无,52 个账号 status 均为 ok。本次关注列表统计严格对应 2026-08-21 08:00 至 2026-08-22 08:00(北京时间);另混编 9 条近一日 buildernews 外部信号,它们不参与窗口账号统计,也不扩展该精确 24 小时承诺。