X 日报个人阅读

2026 年 9 月 24 日 · 周四

2026-09-23 08:00 至 2026-09-24 08:00(北京时间)

52/52

关注账号覆盖

20

条入选

6

个主题

晨间播报

开车或走路时直接听;会记住播放速度和上次听到的位置。下载 MP3

编辑导言

本期最值得展开的不是模型名字又换了一轮,而是 AI 开始接手哪些具体动作。ChatGPT Voice 接入邮件、日历和 Slack,Gemini 把第三方应用带进对话,Zapier 则提出让 Agent 搭建自动化、让代码执行确定性步骤、出错后再交回 Agent。把这些发布放在一起看,产品竞争正在从回答质量延伸到任务能否持续运行。对团队而言,值得试的不是再添一份订阅,而是挑出一个有明确收益、能检查结果的流程,真正跑通。

能力与成本也不能拆开看。Google 的新 TTS 同时强调表达控制和规模化使用,开源追赶与闭源降价引来争论,但个人试用感受和厂商性能宣称都不能替代业务验收。今天另一组声音恰好提醒了这个边界:3D 演示不等于复杂自动化能力,心理健康对话需要专门评测,发现一种酶系统也不等于已经知道它能做什么。

风险讨论同样没有形成单一答案。Bengio 强调失控 Agent 的威胁,Gebru 把注意力拉回数据中心的现实负担,Bindu Reddy 则担心先进能力集中在少数实验室。把这些分歧保留下来,比把它们合写成一句支持或反对 AI 更有价值:我们既要问系统能做什么,也要问谁能使用、谁承担代价,以及它代表用户行动时负有什么责任。

01语音开始办事

语音一端获得更细的生成控制,另一端接入工具,正从聊天方式变成任务入口。

OpenAI@OpenAI

OpenAI 宣布 ChatGPT Voice 可调用邮件、日历和 Slack 等插件,支持 GPT-6 Astra、Sol、Luna,并进入网页和移动端 ChatGPT Work,可通过语音创建文档、演示稿、网站和表格,或处理浏览器中的复杂任务。官方称将于当天在最新版应用中全球逐步推出。

赞 9.2k转 649评 538原帖 ↗
Google AI@GoogleAI

Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,称支持超过 100 种语言、逾 2000 种现成声音,以及逐句控制、对话和笑声等表达提示。Flash 面向高保真创作和定制声音,Flash-Lite 面向近实时语音 Agent、批量配音与低成本规模化生成。

赞 1.6k转 144评 87原帖 ↗
Logan Kilpatrick@OfficialLoganK

Logan 补充,新一代 TTS 配套 Google AI Studio 的新体验,使用成本低于此前的 3.1 Flash TTS。帖文没有给出具体单价或降幅。

赞 153转 3评 23原帖 ↗

02从应用连接到流程落地

连接应用只是起点,可靠执行、异常恢复和业务收益才决定自动化是否值得部署。

Wade Foster@wadefoster

Zapier 推出 beta 版 Next Gen Zaps:用户可在 Claude、ChatGPT 等 Agent 中描述需求,生成能在电脑关闭后继续运行的自动化。其设计将确定性步骤固化为代码,以降低成本并提高可靠性;流程出错时再回到 Agent 模式尝试恢复。Wade 同时表示早期数据仍有待学习,并未宣称可靠性问题已经解决。

赞 31转 5评 4原帖 ↗
Google Gemini@GeminiApp

Gemini 宣布新增连接 13 个应用,包括 Adobe、Squarespace 和 Peloton,让用户在对话中处理经营、设计素材和健身计划等任务,减少在不同应用标签页间切换。

赞 1.1k转 123评 106原帖 ↗
Google Gemini@GeminiApp

Gemini 展示 Airtable 连接能力:搜索工作区和数据库,管理表格、记录、页面与自动化。示例是用自然语言找出项目管理数据库中所有未完成任务,直接对应团队日常的数据查询需求。

赞 21转 4评 1原帖 ↗
Google Gemini@GeminiApp

Gemini 展示 Webflow 集成:生成响应式布局、调整页面样式并更新 CMS。给出的示例包含添加 FAQ 区块并发布网站变更,意味着应用连接不只读信息,也可涉及实际写入与发布。

赞 16转 1评 1原帖 ↗
Alex Kruger@KrugerSays

Alex 反对把购买 Claude、Cursor、ChatGPT 订阅当成完整的 AI 战略。他建议逐部门梳理阻碍效率和收入的环节,按潜在回报与建设耗时排序,只选少数机会并投入到真正跑通,而不是期待员工自行摸索出结果。

赞 3转 0评 2原帖 ↗

03模型性价比仍有争议

降价、开源追赶与系统增强同时出现,但价格变化和个别测试尚不足以判定通用能力胜负。

Bindu Reddy@bindureddy

Bindu 把闭源模型降价视作开源竞争奏效的信号,并提到 Anthropic 与 OpenAI 都有降价。这是她对竞争关系的解释,帖文没有提供足以证明降价原因的数据。

赞 228转 10评 27原帖 ↗
Bindu Reddy@bindureddy

Bindu 表示,个人测试中 GPT 6 Sol 虽更便宜但效果更差,Opus 5.5 的表达更自然却未体现智能跃升。她据此预测开源差距可能在年底归零;这是未附测试方法的个人判断与预测,不是通用评测结论。

赞 298转 12评 88原帖 ↗
Emad@EMostaque

Emad 称,其开放自适应智能系统 Zenith 能增强 DeepSeek v4.1 Flash,使其在高难度长程任务上超越 GPT 5.6 Sol。值得关注的是以系统设计提升较低成本模型表现的路线,但原帖未给出足够的测试细节,不能据此认定全面领先。

赞 175转 21评 10原帖 ↗

04评测要贴近使用场景

从炫技演示转向领域评测,才能知道模型表现是否覆盖真正需要承担的任务。

Bindu Reddy@bindureddy

Bindu 质疑用 3D 游戏演示评价模型,认为实验室可能针对这类用例优化,而演示效果并不能证明复杂自动化或编程能力。她提醒读者不要把一个擅长展示的场景当成总体能力的替代指标。

赞 142转 10评 41原帖 ↗
OpenAI@OpenAI

OpenAI 发布开放基准 MentalHealthBench,称设计过程吸收了超过 80 位心理健康临床专业人士的意见,用于评估贴近现实的心理健康对话。开放方法和评测允许其他研究者检查与复用,但帖文本身没有提供临床疗效证据。

赞 2.8k转 144评 252原帖 ↗

05科研与物理世界的进展

AI 正进入生物研究、公共卫生和机器人系统,但发现、应用尝试与成熟成果必须分清。

Anthropic@AnthropicAI

Anthropic 称 Claude 在噬菌体 DNA 中发现此前未知的酶系统,其基因旁有类似 CRISPR 的长重复 DNA 阵列。官方明确表示尚不清楚该系统的功能,是否能像已知可编程系统那样应用于基因医学,仍需要大量研究。

赞 28.2k转 3.3k评 947原帖 ↗
Anthropic@AnthropicAI

Anthropic 称,CEPI、WHO 非洲区域办事处及刚果(金)国家生物医学研究院等机构正在使用 Claude,加快应对当地一种异常 Ebola 变体的暴发。原帖未披露具体工作环节或量化成效。

赞 389转 27评 37原帖 ↗
Microsoft Research@MSFTResearch

Microsoft Research 介绍一项机器人研究:将 AI 推理移到机器人本体之外,有望提高任务成功率与效率,并承载更复杂的 physical AI 工作负载。帖文没有展开部署架构、通信条件或提升幅度。

赞 57转 7评 2原帖 ↗

06风险、责任与能力分配

失控风险、现实资源负担和能力集中是不同问题,不能用同一种安全叙事代替讨论。

Yoshua Bengio@Yoshua_Bengio

Bengio 表示受邀在联合国安理会讨论不受控制的前沿 AI Agent 带来的威胁,呼吁把灾难性风险治理置于个人、商业和国家利益之上,并尽快行动。帖文没有列出具体政策措施。

赞 449转 128评 40原帖 ↗
@timnitGebru (@dair-community.social/bsky.social)@timnitGebru

Timnit Gebru 分享与 Emily M. Bender 合写的文章,批评 AI 产业将注意力引向假想的机器神,而淡化数据中心的气候影响、周边居民健康、电费和冷却用水问题。这是对风险议题优先级的质疑。

赞 531转 202评 18原帖 ↗
Bindu Reddy@bindureddy

Bindu 担心限制超级智能会加剧能力集中,使少数实验室保留用于生物、纳米技术和聚变创新的先进模型,其他人只能使用较弱版本。她主张通过竞争推动顶级模型开放使用;这是政策立场与风险推演,而非已发生的事实。

赞 100转 11评 20原帖 ↗
Emad@EMostaque

Emad 提出一个责任边界问题:Agent 在什么情况下应成为负有信义义务的受托人?原帖仅提出问题,没有给出法律判断或制度方案。

赞 52转 1评 22原帖 ↗
低信号与抓取缺口

第一类,窗口内零发帖:依据审计中 status=ok 且 window_post_count=0,共 36 个账号窗口内无更新:@Red_Xiao_、@ManusAI、@tydsh、@hugo_larochelle、@drfeifei、@srush_nlp、@soumithchintala、@OriolVinyalsML、@StanfordAILab、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@AIatMeta、@ilyasut、@seb_ruder、@sundarpichai、@kaifulee、@ylecun、@ThomasOrTK、@karpathy、@demishassabis、@lexfridman、@JeffDean、@elicollins、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@IBMResearch、@fchollet、@rowancheung、@ID_AA_Carmack、@geoffreyhinton、@AndrewYNg、@sama。 第二类,有发帖但未选入主报告:共 4 个账号,均发了但未入选,不能视作无更新。@steipete 的 2 条主要是简短互动及缺少具体项目背景的回复;@ZackKorman 的 3 条主要是互动、讽刺及依赖对话上下文的讨论;@GoogleDeepMind 的 1 条 TTS 发布与已选 @GoogleAI 内容重合;@gdb 的 1 条语音升级说明与已选 @OpenAI 内容重合。已入选账号的其余帖子也按信息增量筛选,未逐条收录。 第三类,抓取失败:无。52 个关注账号的审计状态均为 ok。 本次关注列表窗口为北京时间 2026-09-23 08:00 至 2026-09-24 08:00,基于已有 55 条 raw 帖选入 20 条、归为 6 个主题;全部入选帖均在该窗口内。buildernews 候选料已审阅,本期不选入,以保持主报告全部链接来自关注列表 raw;外部 feed 不参与上述账号分类。本文仅依据已有帖文编写,未重新抓取或核验外链内容,个人预测、厂商宣称与已验证成果不作等同处理。