本期最清晰的主旋律,是 AI 从可调用的模型变成可共同工作的系统。团队开始用 agent 构建 agent 产品,用共享 session 保留协作上下文,用 PR 视频把界面变化变成可见证据;与此同时,ChatGPT 的订位搜索和自动选模说明,模型正在退到产品体验背后。真正有价值的进展,不再只是模型跑分,而是工作流能否减少切换、审阅与手工选择。
另一条信号更值得管理者展开:AI 降低执行成本后,稀缺资源正在转向判断、领域知识、分发与责任机制。更小的团队可以承担更大的产出,但安全告警一周后才审阅、基础控制缺失却被包装成行业探索,也暴露出治理速度没有跟上执行速度。能力扩张与问责滞后同时出现,才是今天这批声音真正的张力。
Agent 开发的竞争点正从单次生成,转向共享上下文、验收证据与长任务执行。
团队开始直接用 OpenClaw 开发 OpenClaw,并把 agent session 以 URL 分享;可传递的完整执行上下文正在成为协作基础设施。
他在共享 AGENTS.md 中加入一条短规则:凡 PR 改变 UI 状态,都要上传演示视频。重点不是多写文档,而是把视觉验收变成默认交付证据。
他向社区征集 Codex 本周解决的高难度问题,以及大家学习前沿用法的渠道。527 条回复说明,真实案例与同伴经验已成为 agent 能力扩散的重要接口。
一次 /goal 任务在 CLI 工具充分的条件下,用 14 小时一次性完成了极详细规格。案例提示,长任务的上限越来越取决于目标描述与工具供给,而不只是 token 效率。
搜索、订位与自动选模正在把模型能力封装成无需理解底层配置的产品动作。
ChatGPT 开始提供餐厅订位搜索,把对话入口进一步连接到真实交易动作。
他补充称,在 ChatGPT 中快速查找餐厅空位已经明显简化,并与一批新功能同步上线。产品价值落在缩短完成路径,而非展示模型本身。
OpenAI 的产品方向是逐步取消用户手动选择模型,让系统根据任务自行路由能力。
Gemini 3.7 Flash 已进入 Gemini App,新的快速模型直接成为应用能力,而不是只停留在开发者接口。
当执行成本下降,团队规模不再等于产能,产品判断、领域知识与分发成为新的稀缺项。
他观察到 B2B 营销团队正在收缩为一位美国市场负责人,加四至五位覆盖内容、投放、运营和设计的 AI 增强型执行者,这已成为其当前主要用人需求。
她用 token rich 与 token poor 区分两种组织心态:一类把 AI 当作放大个人产出的投资,另一类只把便宜模型当作节省人工成本的工具。长期差距来自目标函数,而非单次模型价格。
当 AI 让人人都能构建产品,真正的差异化会转向 product sense、领域知识、分发和执行。代码生产能力普及,不等于商业能力同质化。
他借蒸汽机、高级语言和电子表格说明 Jevons 式扩张:任务成本下降通常不会减少总需求,反而会让原本不经济的软件需求大量进入可行区间。
前沿实验室拥有更强能力与话语权后,安全响应速度、基础控制和外部问责也被放到同一张账上。
Anthropic 用 AI 监控内部 agent 使用本身值得肯定,但告警要在一周内才完成人工复核;监控自动化与响应时效之间存在明显断层。
他批评 OpenAI 与 Anthropic 安全事件的事后复盘充满辩解,并认为如果实验室继续维持与涉事合作方的关系,安全承诺就缺少实际约束。
他认为 OpenAI 与 Anthropic 对 AI 安全叙事拥有过强控制力,以至于 MFA 和密码管理等基础控制的缺失,也可能被受众误读为某种前沿实践。
她质疑 Anthropic 将新一代前沿模型保留为内部科研工具的做法,认为这会把生物、物理和医学等高价值能力集中在单一公司。该帖表达的是权力集中担忧,并非对模型能力的独立验证。