X 日报 · 最新一期个人阅读

2026 年 10 月 9 日 · 周五

2026-10-08 08:00 至 2026-10-09 08:00(北京时间)

52/52

关注账号覆盖

20

条入选

6

个主题

晨间播报

开车或走路时直接听;会记住播放速度和上次听到的位置。下载 MP3

编辑导言

这一期值得细看的,不是又一个模型有多聪明,而是 Agent 准备接手哪些具体工作。Google 把企业上下文、持久记忆和多 Agent 编排放进统一入口;Zapier 则拿讲者提醒、销售复盘和团队交接说明自动化如何进入日常岗位。两者之间有一个值得保留的区别:能持续执行,不等于可以绕过审批。Wade Foster 的案例把对外发送前的人审写进流程,比一句笼统的安全承诺更有参考价值。

科研与安全也开始出现更具体的交付物:用已有数据和统计推断补齐紫外全天图、在真实诊所测试问诊辅助、为开源项目提供附带复现和修复建议的漏洞报告。但补全的数据不等于新观测,诊断一致性不等于独立行医能力,投入承诺也不等于科研成果。本期把这些边界与厂商公告一并保留。

另一条线索是如何证明进步。Jax 到 Lean 的形式化验证尝试,与 Chollet 对能力迁移和资本投入的提醒形成呼应:任务做得更好、系统更可靠、投入能够回本,是三件需要分别回答的事。关于研究归功与训练数据的争论也仍在继续,本期只呈现原帖能够支撑的观点,不替缺失的争论背景补故事。

01Agent 进入日常岗位

统一入口正在连接企业上下文与持续执行,真正的落地细节则是任务边界和人工审批。

Sundar Pichai@sundarpichai

Pichai 在 Gemini at Work 宣布面向工作的统一 Gemini agent:从一个输入框完成问答、知识工作、媒体生成及代码编写与运行,连接工作流、业务记录系统和企业管控。其架构强调云端持久记忆、跨设备上下文、子 Agent 编排与多模型选择;这些是此次发布的产品主张。

赞 1.9k转 190评 155原帖 ↗
Thomas Kurian@ThomasOrTK

Kurian 称近 90% 的 Fortune 100 企业已使用 Gemini Enterprise,并列举 Merck 的分子研究、Honeywell 的设备数据分析与预防性维护建议,以及 Lloyds Bank 的欺诈检测和商业客户开户用例。原帖未给出这些案例的量化收益,采用比例也不等于全企业部署深度。

赞 89转 3评 5原帖 ↗
Wade Foster@wadefoster

Foster 分享 Zapier 内部用 Next Gen Zaps 处理 200 多封讲者提醒、成交复盘、周报和文档维护的案例。关键做法是把人审嵌入流程:低风险工作自动运行,讲者邮件和客户外联先由人批准。产品仍处于面向 Pro、Team、Enterprise 的 early access 阶段。

赞 6转 2评 0原帖 ↗
Rowan Cheung@rowancheung

Cheung 分享四类 GrokBot 定时任务:筛选真实 AI 工作流、监测品牌提及、发现潜在需求及提醒跟进新联系人。提示词明确要求保留来源、去重、报告检索失败,并限制为 Slack 汇总或待办草稿,不自动回复、发邮件或联系他人。

赞 45转 7评 19原帖 ↗

02科研投入与实测

资金承诺、数据整理和真实场景研究同时推进,但需要区分计划、推断结果与已完成的验证。

Anthropic@AnthropicAI

Anthropic 宣布向 Genesis Mission 承诺投入 1.5 亿美元,并向超过 15 个联邦机构提供 Claude 与技术支持,以支持科学研究和技术发现。原帖描述的是投入与支持承诺,并非已兑现的研究成果。

赞 2.4k转 178评 179原帖 ↗
Demis Hassabis@demishassabis

Hassabis 表示本周以 1.5 亿美元投资支持 Genesis Mission,并期待围绕科学研究开展合作。这是另一方针对同一计划的表态,不与 Anthropic 的承诺混记为同一笔投入。

赞 211转 11评 51原帖 ↗
Anthropic@AnthropicAI

Anthropic 介绍天体物理学家 Brice Ménard 使用 Claude Science 搜集并合并已有数据、以统计推断填补空白,制作紫外全天图的案例。按其叙述,原本数周的数据整理缩短至数天;图中补全区域并非新增观测,成果被定位为教学工具及低优先级科研工作的示范。

赞 2.2k转 217评 123原帖 ↗
Sundar Pichai@sundarpichai

Pichai 介绍发表于 The Lancet 的 AMIE 前瞻性研究:在真实急诊门诊场景中,就诊前对话系统协助采集病史。按其披露,临床医生在 75% 的病例中认为摘要有助于准备,超过一半病例的诊疗思路受到影响,系统鉴别诊断与医生最终诊断的一致性为 90%;这不等于独立诊断准确率或可替代医生。

赞 227转 39评 69原帖 ↗
IBM Research@IBMResearch

IBM 宣布入选 DARPA Quantum Benchmarking Initiative 的 Stage C,下一步接受独立测试。其首台容错量子计算机 IBM Quantum Starling 仍计划于 2029 年推出,进入测试阶段不代表该机器已经建成。

赞 72转 18评 4原帖 ↗

03安全从倡议到工具

基础设施防护和开源漏洞扫描给出具体行动,研究者仍在追问前沿 AI 工作的风险方向。

Anthropic@AnthropicAI

Anthropic 宣布 Critical Infrastructure Defense Program,计划向电网、供水等运营机构的安全、制造和技术供应商提供前沿 Claude 模型、驻场工程师及研究支持,帮助保护关键基础设施。

赞 192转 6评 16原帖 ↗
Anthropic@AnthropicAI

Anthropic 推出 OSS Scanner,面向自愿加入的开源项目免费定期扫描漏洞,报告将包含概念验证、问题解释和建议修复。这比只输出风险告警更接近维护者可以复现和处理的工作项。

赞 272转 31评 20原帖 ↗
Yoshua Bengio@Yoshua_Bengio

Bengio 在介绍其 Transformer 评论文章时,呼吁前沿 AI 公司的员工审视自己的工作是否真正通向更安全的未来,并强调行动的紧迫性。原帖给出的是职业责任与风险方向的倡议,没有展开具体技术方案。

赞 448转 106评 31原帖 ↗
Zack Korman@ZackKorman

Korman 反对把每次零日漏洞或安全事件都当作网络安全无效的证据。他提醒,理解安全工作的价值,不能以是否仍有事故发生作唯一判断。

赞 105转 6评 11原帖 ↗

04能力要怎样验证

从张量代码的形式化证明到意外失败分析,验证需要比看起来聪明更具体的标准。

Sasha Rush@srush_nlp

Rush 分享 Provably Correct Tensor Puzzles,通过构建 Jax 到 Lean 的转译器,对 Python 机器学习代码进行形式化验证。帖文指向一种用证明检查代码正确性的具体尝试,而非仅靠运行样例建立信心。

赞 159转 9评 5原帖 ↗
François Chollet@fchollet

Chollet 以编程和数学训练为例,认为领域练习提升的是该领域技能,不能直接推导出通用推理能力或跨领域学习速度提高。他借人类能力迁移的讨论提醒:专项成绩进步与通用智能增强应当分开判断。

赞 1.3k转 132评 90原帖 ↗
Microsoft Research@MSFTResearch

Microsoft Research 介绍 Jennifer Neville 的访谈观点:最重要的 AI 失败未必是显而易见的错误,令人意外的失败能揭示人们对智能的预期与系统实际运作方式之间的差距。

赞 8转 1评 0原帖 ↗

05研究贡献如何归属

训练数据与思想优先权引发不同争论,不能把模糊设想、既有知识和经验证的成果混为一谈。

Yann LeCun@ylecun

LeCun 批评把后续创新的全部功劳追溯给早年模糊设想的做法,尤其是那些缺乏理论、实验验证和长期跟进的主张。他强调不能仅凭足够宽泛的描述,就将所有新成果算作原始想法的特例;原帖未点明具体对象。

赞 33转 2评 6原帖 ↗
Bindu Reddy@bindureddy

Reddy 反驳一位 NYU 数学教授对 LLM 窃取研究想法的指责,认为研究者本来也会阅读已有工作,不能仅因模型使用公开数据训练就直接下此结论。这是她对训练与借鉴关系的立场,不是对版权或具体研究归属的裁决。

赞 316转 17评 56原帖 ↗

06投入最终要变成价值

行业增长需要可持续利润,企业落地需要能把业务问题转成有效方案的人。

François Chollet@fchollet

Chollet 提出一个投入产出视角:他认为 2023 至 2026 年多数 AI 进展指标近似指数增长,而资本支出略超指数增长,因此相对外部投入的产出响应略低于线性。其判断是,长期维持指数进步不能只靠加速注资,还需相匹配的利润增长;这是原帖的宏观分析,并非本期独立核验的统计结论。

赞 250转 27评 41原帖 ↗
Alex Kruger@KrugerSays

Kruger 认为优秀的 AI 实施人才不只是工程师,还要能与 CFO、CRO、CMO 识别业务问题、规划方案、组织工程交付,并确认最终产物确实解决问题。帖文同时带有其人才服务的推广,但对岗位能力组合的描述具体。

赞 1转 0评 0原帖 ↗
低信号与抓取缺口

第一类,窗口内零发帖:按审计中 status=ok 且 window_post_count=0 的口径,共 33 个账号窗口内无更新:@steipete、@Red_Xiao_、@ManusAI、@tydsh、@hugo_larochelle、@drfeifei、@GeminiApp、@soumithchintala、@OriolVinyalsML、@StanfordAILab、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@AIatMeta、@ilyasut、@seb_ruder、@kaifulee、@karpathy、@lexfridman、@elicollins、@gdb、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@GoogleDeepMind、@GoogleAI、@ID_AA_Carmack、@geoffreyhinton、@AndrewYNg、@OpenAI、@sama。 第二类,有发帖但未选入主报告:共 4 个账号,@OfficialLoganK(2 条,宏观乐观判断与缺少上下文的链接)、@EMostaque(3 条,方案细节不足、理论推广及调侃)、@timnitGebru(4 条,以争论性评论和影视评价为主)、@JeffDean(1 条,缅怀 Margaret Hamilton 的个人表达,未为单条另凑主题)。这些账号均发了但未入选,不能视为无更新。另有 15 个发帖账号至少一条入选;同事件重复公告、短回复和信息不足的帖子做了取舍。 第三类,抓取失败:无;52 个账号的审计 status 均为 ok。 本次仅基于冻结的 raw/audit 编辑,从 43 条关注列表原帖中选入 20 条,未纳入 buildernews,不重新抓取或改写原始文件。关注列表入选帖均发布于 2026-10-08 08:00 至 2026-10-09 08:00(北京时间)。账号分类沿用上游审计;其中多数 first_page_covers_window_start=false,成功状态与零条计数本身不额外证明分页覆盖完整,本期不对未抓到的历史记录作推断。

往期

共 113 期,按日期倒序。

2026 年 10 月 · 7 期

2026 年 9 月 · 28 期

2026 年 8 月 · 30 期

2026 年 7 月 · 15 期

2026 年 6 月 · 30 期

2026 年 5 月 · 3 期