Challen · X Following Dispatch No. 20260919

THE FOLLOWING

关注列表·北京时间24小时声音
2026-09-19 ★ 14 条 · 5 个主题 · 52 个账号 ★ COBALT GRID
编辑导言 FROM THE EDITOR

本期最值得展开的不是新模型传闻,而是企业开始把软件的修改权拿回自己手里。Alex Kruger 的跨渠道广告创意看板,把素材、产品和营销角度放在同一处分析,需求变化后不再等待供应商排期;李开复则把 AI 转型的责任推回管理层。两条声音放在一起,提醒我们衡量 AI 的价值应看业务如何运转,而不只是团队用了多少工具。共享 Agent 会话和面向家庭的协作产品,也在把使用单位从一个人扩展到一群人。

成本与安全是这条路上的两道现实约束。Emad 提倡让便宜模型处理常规任务、难题再请强模型介入,但价格案例与厂商预告都不能代替自己的任务测试。安全侧则同时出现独立评估投入、企业监测建议,以及对风险叙事的尖锐质疑。值得保留这种分歧:既要看到能力带来的风险,也不能让宏大叙事掩盖产品错误。Carmack 分享的方法在自己的任务上没有提升,恰好给本期收了一个务实的底:解释更优雅,不等于效果更好。

覆盖 52/52 个关注账号 · 14 条入选 · 聚为 5 个主题 · 由 AI 实时归纳,仅供参考
§ 第 Ⅰ 章 §
◆

把软件修改权拿回来

共 2 条

自建业务工具与管理层承担转型责任,指向比工具采用率更具体的组织变化。

Alex Kruger @KrugerSays

团队自建营销看板,用 AI 识别广告创意、所售产品和营销角度,再比较跨渠道表现,区分素材本身不好还是只在某个平台失效。他认为关键收益是修改权:想直接查看创意素材,内部团队下一版就能补上,不必等待 SaaS 供应商排期;客户也开始提出类似定制需求。

♥ 2⇄ 0✎ 0原帖 ↗
Kai-Fu Lee @kaifulee

李开复认为 CEO 不能再把 AI 转型简单委托出去,企业需要明确负责人,并改变领导者决策和组织运行的方式。他以面向企业领导者的 Boss AI 决策助手为探索案例,强调只做 AI 展示并不够。

♥ 36⇄ 4✎ 4原帖 ↗
§ 第 Ⅱ 章 §
◆

Agent 走向多人协作

共 2 条

从共享会话到家庭协调,Agent 产品开始处理多人的上下文与配合问题。

Peter Steinberger 🦞 @steipete

分享多人协作同一 Agent 会话的体验:能够看到别人正在输入什么,避免多人向 Agent 发送重复指令。原帖没有说明具体产品名称,但明确点出了共享会话中的协作反馈价值。

♥ 275⇄ 10✎ 50原帖 ↗
Google AI @GoogleAI

Google 周报称,CC 已从个人效率工具扩展为面向家庭的共享 Agent,帮助协调日程和日常事务。同批更新还包括 Gemini 3.8 Live 与 Extended Thinking 音频模型、正式开放的个性化故事产品 Dreambeans 和图像工具 Google Pics,以及基因组探索平台 AlphaGenome Atlas。

♥ 329⇄ 24✎ 29原帖 ↗
§ 第 Ⅲ 章 §
◆

按任务分配模型成本

共 3 条

便宜模型与高能力模型各有位置,选型需要同时看任务难度、长循环表现和价格。

Emad @EMostaque

以“60 亿 tokens 花费 65 美元”的案例讨论模型分工:便宜模型在难题上不如 Astra、Fable,但常规任务未必需要最强模型,必要时再调用强模型求助。原帖没有交代完整计费条件,这一数字不宜当作通用报价。

♥ 225⇄ 8✎ 22原帖 ↗
Bindu Reddy @bindureddy

预告周二将发布新的开放权重模型,并接入 RouteLLM API 与 coding agent。她宣称其价格约为 DeepSeek Flash 的三分之一,长 Agent 循环表现提升 15%,适合九成编程任务;这些是发布前宣传口径,帖中未给出模型名称或可复核评测条件。

♥ 231⇄ 14✎ 31原帖 ↗
Bindu Reddy @bindureddy

据她对平台使用情况的观察,Astra 是增长最快的高价模型,在研究、数据分析和浏览器操作上受到企业用户欢迎,但用户仍希望降价。她同时称其没有零数据保留方面的问题;原帖未提供统计口径、对照测试或数据保留条款,不能据此替代采购与合规核验。

♥ 21⇄ 0✎ 5原帖 ↗
§ 第 Ⅳ 章 §
◆

训练改进要过实测关

共 2 条

训练提速与价值估计修正是不同问题,方法上的进展必须与具体任务收益分开看。

Stanford AI Lab @StanfordAILab

介绍 Context-Sharded Block Parallelism(CSBP),一种面向 diffusion LLM 的分布式并行策略,称其收益随上下文长度增加。公布的训练加速分别为:DFlash2 推测解码草稿模型 7.59 倍、block diffusion 微调 1.61 倍、自回归模型向 block diffusion 适配 1.33 倍;这些是不同训练场景的结果,不是统一推理加速比。

♥ 62⇄ 6✎ 2原帖 ↗
John Carmack @ID_AA_Carmack

分享借助聊天模型理解 Relative Value Learning 的过程,将核心操作归纳为对 TD error 做中心化,但在自己的任务上没有获得性能提升。他进一步怀疑 Q-learning 的高估来自对未实际执行的最大价值动作进行 bootstrap,这些估值缺少向下修正压力;这是他基于实验提出的解释,而非已验证的通用结论。

♥ 435⇄ 25✎ 40原帖 ↗
§ 第 Ⅴ 章 §
◆

安全评估与人的责任

共 5 条

评估投入、企业监测与风险叙事之争并行,不能把其中一种声音当成全部安全议题。

Anthropic @AnthropicAI

宣布与 Accenture 合作开展前沿 AI 独立评估,作为将评估人员嵌入 Anthropic 的承诺的一部分。双方各自预计在未来五年投入至少 10 亿美元建设相关能力;这是投入计划,原帖尚未给出评估结果或独立性保障细节。

♥ 1.6k⇄ 154✎ 276原帖 ↗
Zack Korman @ZackKorman

建议企业监测 Agent 的 CoT 或推理摘要,并澄清报道中“我们正在犯罪”只是说明风险信号可能很明显的假设例子,不是实际会话记录中的原话。重点是监测建议与引用边界,不能把示例误报为真实事件证据。

♥ 73⇄ 7✎ 13原帖 ↗
Yoshua Bengio @Yoshua_Bengio

预告将讨论加拿大、德国政府对其非营利初创组织 LawZero 的新支持,以及他所提到的 Hugging Face 网络攻击事件。他认为商业竞赛正在缺乏充分保障的情况下推进模型能力,需要技术方案,也需要公众和政策制定者参与;原帖未提供攻击事件的技术细节。

♥ 13⇄ 2✎ 3原帖 ↗
@timnitGebru (@dair-community.social/bsky.social) @timnitGebru

批评 AI 公司对网络攻击事件采用选择性的传播叙事:有利于营销时强调模型失控,不利于公司形象时则淡化处理。这是她对企业公关的质疑,原帖未交代完整事件背景,不应据此认定具体公司的行为。

♥ 561⇄ 163✎ 6原帖 ↗
Fei-Fei Li @drfeifei

区分 AI agent 与人的 agency:工具可以成为智能体,但人的自主性仍需要人自己维护和增强。她主张利用工具扩展人的行动能力,并始终把以人为中心作为方向。

♥ 1.6k⇄ 272✎ 120原帖 ↗
低信号与缺口
第一类,窗口内零发帖:按审计中 status=ok 且 window_post_count=0 分类,共 38 个账号,窗口内无更新:@Red_Xiao_、@ManusAI、@OfficialLoganK、@tydsh、@hugo_larochelle、@GeminiApp、@srush_nlp、@soumithchintala、@OriolVinyalsML、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@AIatMeta、@wadefoster、@ilyasut、@seb_ruder、@sundarpichai、@ylecun、@ThomasOrTK、@karpathy、@demishassabis、@lexfridman、@JeffDean、@elicollins、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@IBMResearch、@MSFTResearch、@GoogleDeepMind、@fchollet、@rowancheung、@geoffreyhinton、@AndrewYNg、@OpenAI、@sama。 第二类,有发帖但未选入主报告:@gdb,审计记为 1 条,发了但未入选。现有正文仅泛指一个帮助连接 ChatGPT 上下文的小功能,没有具体名称或功能细节,无法据此形成可靠摘要。其余 13 个有发帖账号均至少入选 1 条;这些账号中的简短互动、重复观点、缺少上下文的感叹及未确认传闻作了取舍,不代表账号无更新。 第三类,抓取失败:无。审计中 52 个账号均为 status=ok。 本次为低信号日:32 条 raw 帖低于上游审计所列 35 条动态阈值,精选 14 条组成 5 个主题。账号分类严格按审计字段,条目与指标以 raw 为准,未修改输入或重新抓取。已阅读 buildernews 候选料,本期仅采用关注列表内容,不混入窗口外材料。主报告所有条目发布时间均在 2026-09-18 08:00 至 2026-09-19 08:00(北京时间)内;零发帖结论沿用既有审计,抓取成功不等于本编辑阶段独立验证了全量时间线覆盖。