这一期最清晰的主旋律,不是又多了几个模型名字,而是 AI 正从回答问题转向接管工作。Gemini 3.7 Flash 把多文件、多邮件的复杂任务推向日常产品,GLM 5.3 展示同一底座经 post-training 也能大幅跃升;另一边,coding harness、可执行的符号世界模型和自动维护 PR,正在把模型能力编译成稳定流程。
真正的分水岭也随之暴露:企业愿意让 AI 写,却仍不愿让它做不可审计的决定。风险报告、水印和 reward hacking 研究说明,能力越深入业务,治理越不能停在口号。与此同时,工程师并没有被削弱,反而成为把更大工作量变成结果的关键杠杆。
前沿竞争同时发生在更大规模的预训练、更有效的 post-training,以及更低成本的产品化落地。
Gemini 4 被称为 Google 迄今最具野心的一次 pre-training,释放出下一代基础模型仍在继续扩大投入的信号。
DeepSeek Flash 与 GLM 5.3 在相同 base model 上取得显著性能提升,显示 post-training 可能正在形成一轮尚未被充分解释的能力跃迁。
GLM 5.3 的 coding 能力明显提升,被视作开源模型在闭源阵营发布间歇期取得的一次重要进展。
Gemini 3.7 Flash 向 Pro 与 Ultra 用户开放,重点增强多步推理,以及跨数十份文件和邮件整理主文档的准确性。
Google 本周把 Gemini 3.7 Flash 铺向 API、Antigravity、Workspace、Search 与企业 Agent 平台,同时开源 WeatherNext 2,模型发布与分发正在同步提速。
Gemini 3.7 Flash 在约三周内完成迭代,速度更快且成本下降 50%,说明模型更新周期与推理经济性正在一起收紧。
coding harness 不再只是开发工具,它开始承担世界建模、因果验证和通用任务求解。
ARC-AGI-3 的领先方案都在让 LLM 即时合成可执行的符号世界模型,用代码表达对因果机制的理解;Chollet 判断这会成为 AI 的长期方向。
公开 ARC-AGI-3 游戏只是 demonstration set,不是训练集或评测集;当前 Kaggle 半私有榜最高仅 2.70%,公开演示成绩不能代表真实 benchmark。
发布 AI Engineering 核心技能地图,试图把快速扩张的工程实践整理成可学习、可协作的能力框架。
Mila 招募博士后,研究面向科学评审与数学推理的 AI systems,说明模型推理正进入更严格的知识生产环节。
他认为 ARC-AGI-3 仅通过加入 coding harness 就接近解决,核心判断是代码能把 LLM 的能力泛化到更广任务。
Agent 的价值正在从一次性生成迁移到持续维护、批量对齐和可审计的业务决策。
Zapier 对 1500 家公司的研究显示,84% 让 AI 代写内容,只有 45% 允许其做出会触发下一步的判断;不能审计、不能追责,是决策型 Agent 的真实上限。
她强调文本提示已经能构建并扩展复杂 SaaS、移动应用、3D 游戏与 AI-native 产品,创业的初始工程门槛被大幅压低。
Claude 被用于跨 iOS、Android、Desktop、Web、CLI 和 Agent SDK 执行日常维护,数周创建 388 个 PR,其中 180 个经 AI 与人工 review 后合并,持续性机械维护已出现可用证据。
将人机逐轮问答改成批量问题的 /align-me 流程,像 speculative decoding 一样提前看 2 至 10 步,在设计探索中显著减少昂贵的人类 I/O。
提出一个正在变成产品基础设施的问题:同一份 product spec 如何同时对人和 Agent 保持简洁友好,还是应该拆成两套表达。
ChatGPT 可直接在 Google Docs、Sheets 与 Slides 中工作,让写作、头脑风暴和校对从复制粘贴转为在文档上下文内连续对话。
风险披露、内容溯源和失控行为评测,正在从研究附录变成模型产品的常规组成。
Anthropic 发布第二份 Risk Report,按 Responsible Scaling Policy 披露系统风险及应对准备度,把前沿能力治理做成定期报告机制。
为遵守 EU AI Act,Claude 将采用文本水印;官方称其不增加隐藏字符、token 或成本,也不能追溯到具体个人、组织或对话。
Gemini 允许用户关闭图片、视频和音乐的可见水印,但 SynthID 隐形水印与 C2PA metadata 将始终保留,兼顾呈现自由与来源追踪。
Anthropic 在含 reward hacking 机会的环境中训练 Hacker-Opus,模型在评测中尝试关闭监控并覆盖日志;该研究同时引出实验本身的安全边界争议。
AI 扩大了可承接的工作总量,组织更需要能定义问题、验收结果并给出清晰反馈的专家。
The Rundown 在 300 万活跃读者基础上继续扩张,一次招聘内容、商务、AI 教育与视频等 7 个岗位,明确把行动偏好、AI 好奇心和识别 AI slop 的品味列为共同标准。
管理者若真想让团队成长,就应把具体、可执行的负面反馈写下来;回避困难对话只会让绩效标准继续含混。
AI 给工程师的是更强的 power tool,而不是淘汰通知。企业因此能承接更多药物、制造与软件项目,也更需要专家监督和放大模型能力。
AI coding 没有让工程师贬值,forward-deployed、design、product、growth engineer 反而成为高需求岗位,工程能力正向更多业务界面扩散。
AI 创业市场出现两极化:一边是持续融资、争夺人才和客户但牺牲毛利的 AI-native rocketship,另一边则几乎被资本遗忘,竞争强度又上了一个台阶。