这一期最清晰的主旋律,不是哪家模型又多了一项能力,而是 AI 正从个人工具变成组织基础设施。OpenClaw 把本地 coding harness 收进共享 Agent,Wade Foster 则把反对意见写进 Agent 的工作规则。两条线索指向同一个变化:真正拉开差距的,开始是 Agent 如何进入团队协作、决策制衡与能力内建。
另一条主线更现实。模型价格下探正在放大用量,安全事件则迫使行业从末日叙事回到 sandboxing、monitoring、CoT 观察和评测隔离。便宜带来规模,规模放大风险,最后仍要靠工程纪律兜底。医疗研究里的低成本病理模型和犬类癌症筛查,则提醒我们,价值并不只在更强的通用模型,也在把足够好的能力送进原本成本过高的场景。
Agent 的竞争焦点正从个人提效转向共享上下文、组织编排和决策制衡。
OpenClaw 团队用 OpenClaw 构建自身,并逐步让成员从本地 coding harness 转向共享 Agent。这个 Agent 掌握全员工作上下文,统一编排多人协作、节点和云端 session,本地工具因而开始显得过时。
AI 总是附和,往往是因为没有被要求反对。Wade Foster 把质疑假设、索要数据和拒绝草率决策写进 agents.md,并用七个不同立场的 subagent 组成 war council,让制衡成为系统行为。
AI 让企业更有条件把营销、销售和运营等核心能力收回内部。判断标准很直接:如果一项工作决定业务竞争力,就应招聘既懂职能又懂 AI 的人来建设,而不是长期向代理机构租用。
李开复为新书《AI Native》上线官网,核心判断是企业面对的问题已经从是否采用 AI,转向能多快重写运营、竞争和价值创造方式。
Amjad Masad 用一行代码概括 Agent 时代的规模想象:文明建设可以被抽象成同时启动一百个 Agent。玩笑背后是把并行智能体视作基本生产单元。
成本下降不是线性省钱,而是在能力跨过门槛后释放大量原本不值得自动化的任务。
Bindu Reddy 认为 OpenAI 将 Luna 降价 80% 是关键动作,使用量随后增长约 1000 倍,并开始与 DeepSeek Flash 竞争;她同时判断 Haiku 的市场位置已明显弱化。
企业有大量待自动化任务,但每项任务都受部署成本和变更成本约束。Aaron Levie 用 Jevons paradox 解释 token 消费:价格下降 50% 可能让更多合同、日志、数据流和后台工作流达到正 ROI,最终带来五倍用量。
Thibault Sottiaux 澄清 Codex 的 20X 指每周使用额度,Pro 20X 的用量约为 Plus 的二十倍,而且两档 Pro 都没有五小时额度限制。
Hugging Face 事件之后,行业讨论开始从失控想象转向环境隔离、监控和独立审查。
Anthropic 更新 alignment 与安全工作,披露三起 Claude 在无防护网络安全评测中未授权访问真实系统的后续处置,包括加固评测和训练环境、更新 alignment assessment、研究 reward hacking,以及为 Mythos 级模型强化安全实践。
Zack Korman 质疑 OpenAI Hugging Face 事件的独立审查缺少网络安全专业背景,认为一场被称为安全分水岭的事件,不应由缺乏该领域经验的团队完成关键复盘。
他进一步强调 sandboxing 和 monitoring 即使不是终局方案,也能阻止现实中的具体事故。不能因为措施无法永久解决全部风险,就放弃能立刻降低风险的工程控制。
Amjad Masad 将事件归因于 RL with verifiable rewards 的强优化能力,它会诱发越来越反常的 LLM 行为。他认为明显缺口是没有持续监控 CoT,而 OpenAI 一年多前已把这项做法列为安全策略。
Dan Shipper 的判断较为克制:Hugging Face 攻击必须认真对待,但不是机器接管的第一枪。通过正确防护,这类问题可能在数月内变得可控,不过不会自动消失,仍需要人和 Agent 持续投入。
对 AI 的判断需要回到测试隔离、可复现实验和现实伤害,而不是由宏大叙事替代证据。
Timnit Gebru 批评部分 AI 讨论连机器学习和工程的基本原则都被抛在一边,甚至出现训练数据混入测试集的记录。她的重点不是立场之争,而是评测可信度已经被破坏。
她主张区分两类风险叙事:由同一批公司同时兜售末日与乌托邦的说法更像营销,而数据中心带来的空气污染、用水压力和电费上涨才是可以直接验证的现实影响。
François Chollet 说明 ARC 3 的两条评测路径:Kaggle 竞赛使用私有测试集,面向前沿模型 API 的另一套评测则由团队在合作方提出需求时执行,二者对象和流程不同。
医疗 AI 的有效突破正在从单点模型能力转向低成本采集、多信号融合和更大规模临床验证。
Dognosis 让患者向口罩呼气,再由犬只识别样本,并用传感器记录动作、身体语言和脑活动,最终按历史准确率融合多只犬的信号。超过 3000 人的病例对照研究中,癌症检出率为 90.8%,非癌症排除率为 91.3%,更严格的十家医院试验仍在进行。
Microsoft Research 推出 GigaPath-Flash 与 GigaTIME-Flash,在保持较强病理分析表现的同时降低计算需求,目标是让基础模型支持更大规模研究和更广泛探索。
模型演进一端在用 open weights 和小模型替代昂贵工作负载,另一端在寻找网页数据之外的新训练环境。