Challen · X Following Dispatch No. 20260829

THE FOLLOWING

关注列表·北京时间24小时声音
2026-08-29 ★ 25 条 · 6 个主题 · 52 个账号 ★ COBALT GRID
编辑导言 FROM THE EDITOR

本期最清晰的主旋律,是 AI 产品从“回答问题”继续向“代人执行”推进。Google 把模型、视频、语音、学习空间、邮箱管理和跨应用任务打成一组连续发布,真正的竞争焦点已经不只是单项 benchmark,而是谁能把模型稳定地嵌进用户每天经过的入口。与此呼应,开发者开始反过来要求新产品进入现有 AI harness,而不是再造一个孤立网站。

另一条更值得展开的信号,是 AI 正在进入研发与治理自身的闭环。自动系统发现 FlashInfer kernel 数值问题并提交获接纳的修复,Claude 尝试自主改进其他模型的 alignment,Keras 则直接处理宇宙射线原始时空波形。能力向前走的同时,cybersecurity、export controls、媒体叙事与资本吸收能力也被重新摆上桌面。这不是技术线和社会线各说各话,而是同一轮扩张开始触碰工程控制、制度边界与资源配置。

覆盖 52/52 个关注账号 · 25 条入选 · 聚为 6 个主题 · 由 AI 实时归纳,仅供参考
§ 第 Ⅰ 章 §
◆

从对话到代办

共 6 条

模型竞争正在转向可控生成、跨应用执行和高频场景入口,产品层的闭环比单点能力更重要。

Google AI @GoogleAI

Google 本周集中发布 Gemini 3.5 Transcribe、Gemini Omni 1.1 Flash、Gemini Live 的任务执行能力,以及可组合可信来源的 Expert Intelligence,产品线明显从模型能力展示转向完整工作流。

♥ 433⇄ 25✎ 40原帖 ↗
Google DeepMind @GoogleDeepMind

Gemini Omni 1.1 Flash 开始推送,重点不是单纯提升视频质量,而是增强生成过程的可控性、迭代速度和生产级完成度。

♥ 324⇄ 23✎ 46原帖 ↗
Google Gemini @GeminiApp

Gemini 月度更新把学生资源、多步任务与 Gemini Live 代办能力放在同一条产品叙事里,强调模型正从聊天界面进入学习和日常事务。

♥ 374⇄ 32✎ 28原帖 ↗
Google Gemini @GeminiApp

Gemini Live 新增 Personal Intelligence、Daily Brief、Gemini Spark 和 Gmail 收件箱管理,目标是让语音交互直接触发复杂任务,而不止停留在对话。

♥ 7⇄ 1✎ 1原帖 ↗
Bindu Reddy @bindureddy

她认为 Deepseek Flash 已具备很强竞争力,但过度积极的 tool calling 容易产生无效循环。若能在行动前增加判断,有机会以更低成本逼近 Opus 级表现。

♥ 222⇄ 5✎ 29原帖 ↗
Bindu Reddy @bindureddy

GLM 5.3 大模型开放权重,她强调其生产可用性、经济性和去中心化价值,开放模型仍在通过成本与可部署性扩大 AI 的可及范围。

♥ 120⇄ 6✎ 14原帖 ↗
§ 第 Ⅱ 章 §
◆

AI 进入研发闭环

共 5 条

AI 不只生成答案,也开始发现底层工程问题、执行模型对齐实验,并直接处理科学原始数据。

Anthropic @AnthropicAI

Anthropic 让 Claude 在 48 小时和 1 块 GPU 的限制下,自主研究、提出、训练并测试小模型 alignment 方法,结果显示模型已经能够承担一段相对完整的对齐研究流程。

♥ 2.3k⇄ 191✎ 215原帖 ↗
Anthropic @AnthropicAI

在 10 类 alignment failure 上,Claude 提升了安全分数而未损害通用能力,方法还迁移到未优化 benchmark、Petri 行为审计和最高大 4.7 倍的模型。

♥ 187⇄ 6✎ 4原帖 ↗
Anthropic @AnthropicAI

一次更具方向性的测试中,Sonnet 5 对更强的 Opus 4.8 早期 checkpoint 做 post-training,安全分数接近经过完整对齐训练的生产版本,指向“较弱模型帮助对齐更强后继者”的可能性。

♥ 194⇄ 10✎ 6原帖 ↗
Yuandong Tian @tydsh

自动系统发现部分 FlashInfer kernel 存在数值问题,进一步给出 PR,并获得人类专家接纳。这是 AI 进入底层软件验证和修复闭环的具体案例。

♥ 96⇄ 5✎ 2原帖 ↗
François Chollet @fchollet

天体粒子物理学家用 Keras 直接建模地面探测器采集的原始时空波形,替代传统手工特征,用于反推宇宙射线来自超新星还是黑洞等高难度 inverse problem。

♥ 122⇄ 7✎ 16原帖 ↗
§ 第 Ⅲ 章 §
◆

Agent 工程控制面

共 6 条

企业与开发者开始把 eval、定制、上下文和确定性软件边界视为 Agent 落地的基础设施。

Andrew Ng @AndrewYNg

Andrew Ng 发布面向 agentic coding 的软件工程基础能力地图,核心问题不再是传统工程是否失效,而是哪些基本功需要在 Agent 协作方式下重新组织。

♥ 3.1k⇄ 453✎ 114原帖 ↗
Soumith Chintala @soumithchintala

当任务集合已经明确,围绕真实工作负载做 customization,价值远高于追求抽象的 general 能力。

♥ 372⇄ 20✎ 16原帖 ↗
Madhu Guru @realmadhuguru

企业 AI 栈应保持 model agnostic:先建立覆盖业务结果的 eval suite,再补齐 open model post-training 能力。只有掌握评测和模型定制,才能在质量、成本与延迟之间真正切换。

♥ 173⇄ 11✎ 16原帖 ↗
Peter Yang @petergyang

他每天收到大量独立 AI 产品试用邀请,却更愿意留在已有 ChatGPT、Grok 等 harness 中,因为这些入口已掌握上下文。新产品若不能进入主流 harness,用户不愿为局部能力重新建立账号和数据关系。

♥ 646⇄ 28✎ 144原帖 ↗
Aaron Levie @levie

软件负责数据、权限、业务逻辑和治理的确定性边界,Agent 则在边界内规模化执行任务。Agent 越强,稳定的软件控制面反而越重要,两者会共同扩大企业 IT 市场。

♥ 120⇄ 11✎ 18原帖 ↗
Guillermo Rauch @rauchg

Vercel 把内部验证成熟的 WebGPU 技术产品化,并明确称其为 agent-native devtool:工具从一开始就同时为 Agent 和人设计,而不是事后追加 AI 接口。

♥ 558⇄ 22✎ 42原帖 ↗
§ 第 Ⅳ 章 §
◆

Cyber 防线重估

共 3 条

AI labs 正在取得安全议题的话语权,但能力扩张也迫使行业重新定义实验室应承担的安全标准。

Zack Korman @ZackKorman

他批评当前 cybersecurity 讨论的失真状态,行业对风险的传播方式与实际技术责任之间出现明显错位。

♥ 131⇄ 7✎ 10原帖 ↗
Zack Korman @ZackKorman

AI labs 正在主导 cyber 议程,传统安全公司甚至被当作旁观者邀请联署。其讽刺背后是安全能力、资源和行业话语权向模型公司的迁移。

♥ 278⇄ 22✎ 24原帖 ↗
Zack Korman @ZackKorman

他与 Gary 合写文章,借 OpenAI 与 Hugging Face 事件讨论 AI labs 应达到什么安全标准,试图把争议从舆论攻防拉回可核验的责任边界。

♥ 58⇄ 14✎ 1原帖 ↗
§ 第 Ⅴ 章 §
◆

治理与叙事边界

共 3 条

技术扩散同时触发出口管制、环境影响和学术媒体责任争议,治理冲突正在从抽象原则落到具体机构。

@timnitGebru (@dair-community.social/bsky.social) @timnitGebru

Timnit Gebru 批评主流媒体在 AI 环境影响问题上放大受资助的反对声音,认为榜单与报道机制正在帮助特定产业叙事获得合法性。

♥ 95⇄ 20✎ 2原帖 ↗
@timnitGebru (@dair-community.social/bsky.social) @timnitGebru

她进一步批评带有知识权威外观的出版物将优生学带入主流,认为学术与媒体机构的包装能力可能比公开的右翼传播更具迷惑性。

♥ 250⇄ 65✎ 7原帖 ↗
Emad @EMostaque

Emad 判断针对 diffusion 的出口管制可能跟随 transformer 限制而来,生成模型的政策边界正在从单一路线扩展到更多架构。

♥ 8⇄ 0✎ 6原帖 ↗
§ 第 Ⅵ 章 §
◆

效率之后的经济题

共 2 条

AI 提升效率后未必减少投入,反而可能扩大需求、现金流与资本配置压力。

Greg Brockman @gdb

他用 Jevons Paradox 提醒市场:单位能力变便宜并不必然减少资源消耗,反而可能因为使用规模扩大而推高总需求。

♥ 977⇄ 56✎ 78原帖 ↗
Garry Tan @garrytan

他推测在足够长的时间尺度上,AI 产生现金流的速度可能超过经济体系找到有效资本用途的速度,真正的瓶颈会从融资转向高质量配置。

♥ 566⇄ 26✎ 120原帖 ↗
低信号与缺口
第一类「窗口内零发帖」:@steipete、@Red_Xiao_、@hugo_larochelle、@drfeifei、@srush_nlp、@OriolVinyalsML、@StanfordAILab、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@AIatMeta、@wadefoster、@ilyasut、@seb_ruder、@sundarpichai、@kaifulee、@ylecun、@ThomasOrTK、@karpathy、@demishassabis、@lexfridman、@JeffDean、@elicollins、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@IBMResearch、@MSFTResearch、@rowancheung、@ID_AA_Carmack、@Yoshua_Bengio、@geoffreyhinton、@OpenAI、@sama,共 36 个账号,审计状态均为 ok 且 window_post_count 为 0。第二类「有发帖但未选入主报告」:@ManusAI、@OfficialLoganK、@KrugerSays,共 3 个账号;它们在窗口内有发帖,但内容分别以客服回复、资格说明或低互动个案为主,因此发了但未入选。第三类「抓取失败」:无,52 个账号全部抓取成功。本次主报告严格采用 2026-08-28 08:00 至 2026-08-29 08:00(北京时间)的关注列表帖子,并混入少量 buildernews 近一日外部信号;外部信号不参与上述账号统计,也不改变精确窗口口径。