这期的主旋律不是某个单点发布,而是 AI 生态正在围绕“谁能用模型、怎样用模型、模型到底擅长什么”重新划线。开源权重、监管、国家竞争力和安全叙事挤在同一个议题里,关注列表里 Bindu Reddy、Zack Korman、Emad、Yoshua Bengio 的讨论都指向同一件事:模型能力已经足够强,接下来真正改变格局的是访问权、部署权和解释权。
另一条线更贴近日常工作流。Zapier 的数据、Manus 的多账号连接、Claude Cowork 的日历管理、ChatGPT Work 的促销和编辑自动化案例都在提醒:AI 不是每一步都该上模型。更成熟的用法是把模型放在判断、协调、表达和分析这些高杠杆环节,把其他部分留给稳定代码和系统逻辑。
还有一组更冷静的声音来自 Chollet、Sasha Rush 和 Microsoft Research:能力曲线仍然尖锐,形式化知识、科学研究和具身产品都需要现实反馈。今天的信号像一张分层图,上层是监管与市场争夺,中层是工作流改造,底层仍是评估、验证和真实世界约束。
开源权重从技术路线变成产业主权问题,安全叙事和竞争力叙事开始正面冲突。
她认为 Kimi K3 在发现网络安全问题上强于被削弱后的 Fable 和 Sol,并把这解读为美国监管正在削弱本土 AI 与安全技术竞争力。
她警告美国可能禁止开源模型,认为如果成真,欧洲和中国会在全球 AI 市场获得结构性优势。
他引用 Axios 称美国正考虑禁止中国 open-weight 模型,并反驳“网络安全”理由,认为这不是问题本质。
他区分真实且常见的模型误判风险与假设中的“中国模型后门”风险,认为后者被过度政治化,不是真正的安全治理。
他复盘 Stability AI 当年做开放 LLM 的经验,认为 OpenAI、Anthropic 等如果更早发布高质量边缘开源模型,社区参与对齐也许反而更安全。
他转发 EU AI Office 报告,强调欧盟需要在 frontier AI 上同时提升竞争力、主权和安全。
他认为在强开源替代品只落后前沿模型一步时,限制模型访问会同时损害安全和竞争力,监管逻辑必须重新计算。
他把 cybersecurity 视为衡量 superintelligence 的高质量 benchmark,认为 Kimi K3 在这里表现好,对开放模型是积极信号。
模型在局部任务上的超强表现,正在被误读成通用能力的底座。
他提醒 AI 能力一直是尖峰式分布,行业营销的关键手法是让人误以为最高峰就是能力地板。
他进一步解释这种误读来自拟人化:人类某项能力强常意味着学习能力强,但机器的专项能力不能这样外推。
他调侃数学基础很弱的人会因为让 Fable 解千禧年难题而陷入 AI psychosis,指向模型能力被错误消费的风险。
他用“数学家们要面对存在主义恐惧”的玩笑呼应模型解题能力讨论,但更像是在提醒评估边界会被情绪放大。
他强调变化率比当前指标值更重要,评估 AI 进展时不能只看某个静态分数。
企业开始从“每步都接模型”转向“只在高杠杆判断环节用模型”。
Zapier 分析 1500 个客户后发现,领先 adopters 的流程里只有 18% 步骤用 AI;把 AI 留给判断类任务,成本比每步都走模型低 71%。
Manus 的 Google Workspace connector 新增 Multi-Account,允许同时安全连接最多 10 个账号,目标是把一个 agent 接入多个工作空间。
她分享用 Claude Cowork 管理日历的 prompt:限制会议总时长、去重冲突、学习历史拒会偏好,并要求先询问再更新邀请。
OpenAI 再次用用户反馈换 ChatGPT Work 免费额度,说明 Work 场景正在通过真实用例征集来推动定位和传播。
他称过去一周 AI 已能自动完成 Every 内部约 70% 原本人工处理的 copy edits,这是多年尝试后首次跨过可用门槛。
她提出代码和软件可以变得一次性:临时设计 playground、理解代码的 HTML 页面、一次性 dashboard,都可以用完即丢。
AI for Science 和可执行教材都在把模型能力拉回可验证知识生产。
Anthropic 在 AI for Science 计划中首次发起定向征集,向罕见病治疗研究者提供最高 5 万美元 Claude 使用额度。
他介绍一个形式化教材实验:把 SICM 第一章用 TypeScript/Jax 实现,让代码、数学推导和模拟器保持对齐。
他补充说 Cursor 能较容易地把这种 code-literate 风格迁移出来,问题在于形式类型何时真正有助于文本和知识表达。
Microsoft Research 汇总 Aurora 1.5、Flint、FlowDAgger、Rowhammer agent 和 conversational AI memory 等研究,覆盖预测、可视化、适应和安全。
从自动驾驶到移动马桶,AI 和机器人产品的落地正在进入更具体也更怪异的场景。
Tesla AI 宣布 FSD v14 Lite 取消刹车确认,AI3 车辆也将获得 Self-Driving app 与 streaks 等更新。
他展示中国公司发布的自动驾驶机器人马桶,可通过语音或遥控召唤,属于具身产品奇观但也说明移动底盘正在下沉到日用品。
他补充这款马桶使用类似高端扫地机器人的 lidar、超声波传感器和防跌落检测,用来规划路线并避开障碍。
真正限制 AI 价值扩散的不是想法生成,而是组织角色、现实反馈和内容表达的落地速度。
他总结 nearshore 招聘失败的四个常见原因:按价格而非能力招人、跳过真实 onboarding、把人当小时工却期待精英产出、写出不现实的全能岗位。
他认为 AI 扩散最终受现实世界反馈速度限制,代码采用快是因为单人即可完成生成、测试和运行;生命科学、销售和合同则必须穿过更慢的外部反馈链。
她建议刚开始做社媒内容的人,把别人反复问自己的前三个问题变成视频或帖子;重复说过三次的话,就是值得产品化的定位。