这一期值得细看的,不是又一个模型有多聪明,而是 Agent 准备接手哪些具体工作。Google 把企业上下文、持久记忆和多 Agent 编排放进统一入口;Zapier 则拿讲者提醒、销售复盘和团队交接说明自动化如何进入日常岗位。两者之间有一个值得保留的区别:能持续执行,不等于可以绕过审批。Wade Foster 的案例把对外发送前的人审写进流程,比一句笼统的安全承诺更有参考价值。
科研与安全也开始出现更具体的交付物:用已有数据和统计推断补齐紫外全天图、在真实诊所测试问诊辅助、为开源项目提供附带复现和修复建议的漏洞报告。但补全的数据不等于新观测,诊断一致性不等于独立行医能力,投入承诺也不等于科研成果。本期把这些边界与厂商公告一并保留。
另一条线索是如何证明进步。Jax 到 Lean 的形式化验证尝试,与 Chollet 对能力迁移和资本投入的提醒形成呼应:任务做得更好、系统更可靠、投入能够回本,是三件需要分别回答的事。关于研究归功与训练数据的争论也仍在继续,本期只呈现原帖能够支撑的观点,不替缺失的争论背景补故事。
统一入口正在连接企业上下文与持续执行,真正的落地细节则是任务边界和人工审批。
Pichai 在 Gemini at Work 宣布面向工作的统一 Gemini agent:从一个输入框完成问答、知识工作、媒体生成及代码编写与运行,连接工作流、业务记录系统和企业管控。其架构强调云端持久记忆、跨设备上下文、子 Agent 编排与多模型选择;这些是此次发布的产品主张。
Kurian 称近 90% 的 Fortune 100 企业已使用 Gemini Enterprise,并列举 Merck 的分子研究、Honeywell 的设备数据分析与预防性维护建议,以及 Lloyds Bank 的欺诈检测和商业客户开户用例。原帖未给出这些案例的量化收益,采用比例也不等于全企业部署深度。
Foster 分享 Zapier 内部用 Next Gen Zaps 处理 200 多封讲者提醒、成交复盘、周报和文档维护的案例。关键做法是把人审嵌入流程:低风险工作自动运行,讲者邮件和客户外联先由人批准。产品仍处于面向 Pro、Team、Enterprise 的 early access 阶段。
Cheung 分享四类 GrokBot 定时任务:筛选真实 AI 工作流、监测品牌提及、发现潜在需求及提醒跟进新联系人。提示词明确要求保留来源、去重、报告检索失败,并限制为 Slack 汇总或待办草稿,不自动回复、发邮件或联系他人。
资金承诺、数据整理和真实场景研究同时推进,但需要区分计划、推断结果与已完成的验证。
Anthropic 宣布向 Genesis Mission 承诺投入 1.5 亿美元,并向超过 15 个联邦机构提供 Claude 与技术支持,以支持科学研究和技术发现。原帖描述的是投入与支持承诺,并非已兑现的研究成果。
Hassabis 表示本周以 1.5 亿美元投资支持 Genesis Mission,并期待围绕科学研究开展合作。这是另一方针对同一计划的表态,不与 Anthropic 的承诺混记为同一笔投入。
Anthropic 介绍天体物理学家 Brice Ménard 使用 Claude Science 搜集并合并已有数据、以统计推断填补空白,制作紫外全天图的案例。按其叙述,原本数周的数据整理缩短至数天;图中补全区域并非新增观测,成果被定位为教学工具及低优先级科研工作的示范。
Pichai 介绍发表于 The Lancet 的 AMIE 前瞻性研究:在真实急诊门诊场景中,就诊前对话系统协助采集病史。按其披露,临床医生在 75% 的病例中认为摘要有助于准备,超过一半病例的诊疗思路受到影响,系统鉴别诊断与医生最终诊断的一致性为 90%;这不等于独立诊断准确率或可替代医生。
IBM 宣布入选 DARPA Quantum Benchmarking Initiative 的 Stage C,下一步接受独立测试。其首台容错量子计算机 IBM Quantum Starling 仍计划于 2029 年推出,进入测试阶段不代表该机器已经建成。
基础设施防护和开源漏洞扫描给出具体行动,研究者仍在追问前沿 AI 工作的风险方向。
Anthropic 宣布 Critical Infrastructure Defense Program,计划向电网、供水等运营机构的安全、制造和技术供应商提供前沿 Claude 模型、驻场工程师及研究支持,帮助保护关键基础设施。
Anthropic 推出 OSS Scanner,面向自愿加入的开源项目免费定期扫描漏洞,报告将包含概念验证、问题解释和建议修复。这比只输出风险告警更接近维护者可以复现和处理的工作项。
Bengio 在介绍其 Transformer 评论文章时,呼吁前沿 AI 公司的员工审视自己的工作是否真正通向更安全的未来,并强调行动的紧迫性。原帖给出的是职业责任与风险方向的倡议,没有展开具体技术方案。
Korman 反对把每次零日漏洞或安全事件都当作网络安全无效的证据。他提醒,理解安全工作的价值,不能以是否仍有事故发生作唯一判断。
从张量代码的形式化证明到意外失败分析,验证需要比看起来聪明更具体的标准。
Rush 分享 Provably Correct Tensor Puzzles,通过构建 Jax 到 Lean 的转译器,对 Python 机器学习代码进行形式化验证。帖文指向一种用证明检查代码正确性的具体尝试,而非仅靠运行样例建立信心。
Chollet 以编程和数学训练为例,认为领域练习提升的是该领域技能,不能直接推导出通用推理能力或跨领域学习速度提高。他借人类能力迁移的讨论提醒:专项成绩进步与通用智能增强应当分开判断。
Microsoft Research 介绍 Jennifer Neville 的访谈观点:最重要的 AI 失败未必是显而易见的错误,令人意外的失败能揭示人们对智能的预期与系统实际运作方式之间的差距。
训练数据与思想优先权引发不同争论,不能把模糊设想、既有知识和经验证的成果混为一谈。
行业增长需要可持续利润,企业落地需要能把业务问题转成有效方案的人。
Chollet 提出一个投入产出视角:他认为 2023 至 2026 年多数 AI 进展指标近似指数增长,而资本支出略超指数增长,因此相对外部投入的产出响应略低于线性。其判断是,长期维持指数进步不能只靠加速注资,还需相匹配的利润增长;这是原帖的宏观分析,并非本期独立核验的统计结论。
Kruger 认为优秀的 AI 实施人才不只是工程师,还要能与 CFO、CRO、CMO 识别业务问题、规划方案、组织工程交付,并确认最终产物确实解决问题。帖文同时带有其人才服务的推广,但对岗位能力组合的描述具体。