Challen · X Following Dispatch No. 20260916

THE FOLLOWING

关注列表·北京时间24小时声音
2026-09-16 ★ 13 条 · 5 个主题 · 52 个账号 ★ COBALT GRID
编辑导言 FROM THE EDITOR

本期最值得展开的不是下一款模型的预告,而是 AI 如何接进现有工作。Zapier MCP 为 Claude for Small Business 补齐应用连接,Greg Brockman 则把 ChatGPT Work 的用途直接指向企业数据操作和看板。两条消息放在一起,竞争焦点已经落到一个具体问题上:用户能否少做连接和配置,让 AI 在已有系统里完成任务。

Gemini 3.8 Live 的发布提供了另一条线索。语音交互不只追求说话自然,还要在交谈中调用工具、后台推理,不让任务执行打断对话。与这些产品承诺相对照,开源模型的低成本讨论仍需补上生产可靠性这一关。Emad 的成本比较是个人估算,Bindu Reddy 对 Smaug Flash 的稳定性描述是产品方主张,都不能直接当作选型结论。

这是一个发帖量低于历史阈值的低信号日,但仍有值得细读的研究内容:LeCun 解释 target prop 与 backprop 的关系,Sasha Rush 用 Lean 证明 Transformer 不变量。它们提醒我们,性能宣传之外还要问清楚方法究竟改变了什么、哪些性质能够验证。关于 AI 风险的争论,本期保留经济收益、数据劳动者和对齐对象三个角度,不把立场表达当成已核实事实。

覆盖 52/52 个关注账号 · 13 条入选 · 聚为 5 个主题 · 由 AI 实时归纳,仅供参考
§ 第 Ⅰ 章 §
◆

企业 AI 接入现有工作

共 2 条

从 MCP 应用连接到 BI 数据操作,企业 AI 的价值开始以能否完成具体业务任务来表达。

Wade Foster @wadefoster

Zapier 宣布为 Claude for Small Business 提供 MCP 支持:遇到 Claude 未原生连接的应用时,会自动使用 Zapier MCP。Foster 称现有 Claude connector 已安装超过 77.5 万次,可接入 9,000 多个工具,并新增 40 多个 Cowork skills,覆盖月末结账、周一简报等业务任务。

♥ 32⇄ 5✎ 4原帖 ↗
Greg Brockman @gdb

Brockman 介绍 ChatGPT Work 可围绕企业数据执行操作,包括构建看板;列出的连接对象有 PowerBI、Tableau、Clickhouse、Oracle BI 和 AWS Redshift。原帖强调复用既有工具,未展开权限控制或具体执行边界。

♥ 752⇄ 44✎ 87原帖 ↗
§ 第 Ⅱ 章 §
◆

语音对话与后台执行

共 3 条

同一次 Gemini Live 发布的三条互补信息,分别交代产品定位、交互能力与工具调用支持。

Google DeepMind @GoogleDeepMind

Google DeepMind 宣布 Gemini 3.8 Live 与 3.8 Live Extended Thinking,主打在持续对话的同时进行思考和后台任务处理。这是官方发布定位,原帖未给出独立评测数据。

♥ 2.5k⇄ 251✎ 139原帖 ↗
Google AI @GoogleAI

Google AI 解释两个版本的差异:3.8 Live 侧重速度、成本和规模,支持句中打断、97 种语言切换及视觉上下文;Extended Thinking 则强调边推理边说话,在后台处理多步骤任务并汇报进度。展示场景包括通过 Search Live 的摄像头与语音指导维修。

♥ 1.9k⇄ 183✎ 84原帖 ↗
Logan Kilpatrick @OfficialLoganK

Kilpatrick 从开发者角度补充,Gemini 3.8 Live 除了支持 97 种语言无缝切换,还支持 async tool calls。原帖宣称具备领先的价格与性能,但没有列出具体价格或比较条件。

♥ 3.2k⇄ 175✎ 218原帖 ↗
§ 第 Ⅲ 章 §
◆

低成本模型的生产考验

共 2 条

便宜与可用是两道门槛,成本估算和厂商可靠性承诺都需要真实工作负载检验。

Emad @EMostaque

Emad 估算 DeepSeek v4.1 Flash 的训练成本约为 1,000 万美元,并声称训练和运行成本都比 GPT-6 Astra 低约两个数量级、部分日常设计等基准表现相近。他据此质疑前沿实验室在开源模型足够好之后的商业优势。这些数字和比较属于作者估算与判断,原帖没有提供完整核算依据。

♥ 1.1k⇄ 74✎ 148原帖 ↗
Bindu Reddy @bindureddy

Reddy 指出开源模型在生产负载中可能出现工具调用停滞、挂起 5 至 10 分钟等问题,并称 Smaug Flash 已解决这些问题,可提供接近免费的个人 Agent。这是产品方对可靠性和成本的主张,原帖未附测试方法或结果。

♥ 81⇄ 6✎ 9原帖 ↗
§ 第 Ⅳ 章 §
◆

研究方法与科学应用

共 3 条

训练方法、形式化证明与开放科学资源提供了不同于聊天体验和榜单的技术观察入口。

Yann LeCun @ylecun

LeCun 将一项论文工作解释为 target prop:把每层输入设为自由隐变量,作为上一层的目标,并通过 augmented Lagrangian 将层间一致性约束变成惩罚项。他强调它最终优化的准则与 backprop 相同,主要改变梯度求取方式;其团队早年的工作显示,在编码带 L1 等正则项的 sparse auto-encoder 中,target prop 似乎更高效。

♥ 525⇄ 46✎ 19原帖 ↗
Sasha Rush @srush_nlp

Rush 分享 Lean Verified Transformers:从零开始在 Lean 中证明一组 Transformer 不变量,并讨论把类似证明推广到其他代码有多难。这里验证的是特定形式化性质,不能据此推导模型输出整体正确或安全。

♥ 355⇄ 39✎ 10原帖 ↗
Sundar Pichai @sundarpichai

Pichai 回顾 Google 近一周左右的科学与公共应用进展:向研究者开放覆盖人类基因组 90 亿种可能单碱基变化的 AlphaGenome Atlas,推出 WeatherNext 3,并发布 AI 使用情况研究 AI & Economy ATLAS。他将投入重点概括为健康、灾害与天气韧性、学习和经济机会;这些是近期进展汇总,并非全都在本窗口首次发布。

♥ 3.3k⇄ 323✎ 191原帖 ↗
§ 第 Ⅴ 章 §
◆

风险讨论中的人和利益

共 3 条

经济收益、幕后劳动与对齐对象是不同层面的问题,不能被单一的支持或反对 AI 立场替代。

Bindu Reddy @bindureddy

Reddy 反对禁止 AI,理由包括就业、数据中心带动的蓝领工作和产业收入,并认为开源会进一步推动采用。这是明确的政策立场;帖中关于就业与收入规模的断言未附来源,不作为本报核实过的经济统计。

♥ 142⇄ 11✎ 34原帖 ↗
@timnitGebru (@dair-community.social/bsky.social) @timnitGebru

Gebru 推荐 Data Workers’ Inquiry 中一篇由受雇充当“AI impersonator”的劳动者撰写的亲历故事,将注意力引向 AI 服务背后的人工劳动。现有帖文没有展开具体任务和雇佣细节,不据此补写故事内容。

♥ 200⇄ 75✎ 2原帖 ↗
Emad @EMostaque

Emad 将 alignment 的问题压缩为一句追问:究竟与谁对齐?这是一条关于目标与利益归属的观点,而非新的技术结果。

♥ 22⇄ 1✎ 5原帖 ↗
低信号与缺口
第一类「窗口内零发帖」:按审计 status=ok 且 window_post_count=0,共 35 个账号窗口内无更新:@Red_Xiao_、@ManusAI、@AnthropicAI、@tydsh、@hugo_larochelle、@ZackKorman、@GeminiApp、@soumithchintala、@StanfordAILab、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@KrugerSays、@AIatMeta、@ilyasut、@seb_ruder、@ThomasOrTK、@karpathy、@demishassabis、@lexfridman、@elicollins、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@IBMResearch、@MSFTResearch、@fchollet、@rowancheung、@ID_AA_Carmack、@Yoshua_Bengio、@geoffreyhinton、@AndrewYNg、@OpenAI。 第二类「有发帖但未选入主报告」:共 6 个账号发了但未入选。@steipete 为欢迎加入与缺少上下文的简短交流;@drfeifei 为招聘推荐;@OriolVinyalsML、@JeffDean 为成果祝贺,原帖未展开研究内容;@kaifulee 为电子书与有声书上线推广;@sama 为未披露具体内容的发布预告。这些账号不是无更新。其他已入选账号也有重复转推、简短互动或信息不足的帖子被略去。 第三类「抓取失败」:无。审计中 52 个账号均为 status=ok。 本次为低信号日:raw 共 32 条,低于审计给出的动态阈值 35 条;精选 13 条,归为 5 个主题,均来自关注列表,没有纳入 RT。已阅读外部 buildernews 候选料,本期未采用,不参与上述账号统计。账号分类以现有审计字段为准。主报告全部帖子的发布时间均在 2026-09-15 08:00 至 2026-09-16 08:00(北京时间)内;帖中回顾的事件不一定发生在该窗口,指标为既有抓取快照。