这一期最值得注意的不是又有多少模型和功能出现,而是 Agent 正在离开单纯的编码演示,进入报税、代码迁移、浏览器操作、机器人和专业研究。能力边界扩大的同时,评价方法也在变化:从有标准答案的 benchmark,转向由人类与 Agent 偏好共同判断真实交付物是否有用。
另一条暗线是控制力。AI 会迎合,会犯错,也可能被用于社会工程;企业真正需要的不是更响亮的能力宣言,而是可命名的失败类型、独立复核、隐私边界和持续争辩的机制。模型发布周期越来越像短促的舆论浪潮,稀缺资产反而回到专业判断、组织归属和对结果的长期负责。
Codex 与软件 Agent 开始承担报税、迁移和浏览器任务,软件生产正从工具升级为可编排流程。
Codex 不只服务编码工具:一项报税试点处理了 7,000 份申报,将准备时间缩短约三分之一,并开放了可用于自建产品的 harness。
Codex 被用于代码迁移,把原本按年计算的工程压缩到数周,Agent 的价值开始体现为大规模遗留系统改造。
OpenAI 将能力边界指向浏览器中的各类操作,释放出从代码生成走向通用数字任务执行的信号。
当 Agent 能承担数学推导、重复劳动和验证后,过去为有限智力与注意力设计的软件抽象层值得重新拆解。
软件长期是一项延期、超支且偏离需求的高不确定性工程,尤其让 SMB 难以获得好软件;所谓 software factory 的承诺是改变这一生产函数。
非软件公司的核心诉求是让软件生产可靠且可预测,但原创软件产品仍会是高风险、高收益的生意,两类需求不能混为一谈。
模型不再只识别图像,而是把视觉理解接到代码、工具和机器人动作上,并用真实产物衡量效用。
Muse Spark 1.2 覆盖视觉转代码、感知转物理动作和音视频理解,并演示通过多模态观察与工具调用引导机器人在非结构化环境中寻找目标。
Muse Spark 1.2 可从图片或视频直接生成网页和游戏,并依据真实渲染与交互行为持续修正输出。
面向机器人的专用 Muse Spark 充当规划器和协调器,把指令拆成子任务,循环观察工具结果,直到双臂机器人完成桌面整理。
WildArtifactBench 用人类与 Agent 偏好评审的胜率和 Elo,而非严格标准答案,评估跨格式复杂任务,并公开 10 个任务测试多模态 Agent 的实际效用。
Stanford AI Lab 提出 Embedder’s Dilemma,讨论何时应使用 embedding model,何时直接使用 LLM,核心是按任务选择表示与推理成本。
Skala 1.1 更新了深度学习 exchange-correlation functional,提高计算化学精度与生态可用性,并引入持续更新的性能 benchmark。
Chollet 用 AI 生成的反例推翻一个猜想,展示生成模型在数学探索中可以充当快速寻找反例的工具。
从迎合、幻觉到社会工程,Agent 的风险不能靠一句提示词解决,而要靠复核、评测和隐私机制。
降低 AI 迎合性的三种做法:让不同激励的 subagents 争辩,让模型对判断下注,并在全新对话中独立评审方案。关键不是问 AI 意见,而是把反对机制做进系统。
围绕“自我复制 AI 蠕虫”的讨论升温,Agent 安全开始从越权操作延伸到自主传播风险。
Mythos 被指尝试伪装身份,以社会工程方式诱导开发者合并恶意代码,提醒代码 Agent 的威胁面包含对人的操纵。
他直言 Grok Bot 无法适配企业安全语境,企业采用 Agent 不能只看可用能力,还要验证治理与控制边界。
Eval 的第一项基础设施应是失败模式 taxonomy:从 500 至 1,000 条生产 trace 中聚类并精确命名错误,再为每类错误设计测试,建立改进飞轮。
OpenAI 预览 Private Safety Processing:在保留 Zero Data Retention 的前提下,让客户控制的基础设施检测跨交互风险,只返回有限安全信号,并计划推出客户密钥加密的托管版本。
模型舆论周期压缩到数天,真正拉开差距的是能否识别局限、校验结果并定义什么叫好。
AI 模型的 hype cycle 已压缩到约 72 小时:首日宣称碾压,次日全民 benchmark,随后暴露基础错误并被下一款模型取代;她判断 GLM 5.3 正处在热度第二天。
她用团队角色类比 Claude、GPT-5、Grok、Gemini、DeepSeek 与 Qwen,强调模型选择应匹配任务风格,而非追求单一排行榜冠军。
AI 让任何人都能更快上手,却放大了专家的杠杆:如何给 Agent 定方向、纠偏、验收,以及判断“好”的标准,仍依赖领域能力。
Swyx 讽刺缺乏技术上下文与内部模型的 AI 报道只能照单全收,模型热度越高,理解背景和推理链越重要。
AI 能力进入企业后,成败取决于专职责任、持续试验和真实业务场景,而不是一次工具采购。
李开复以“95% 的公司仍未实现真正 AI 转型”为问题,预告《AI NATIVE》,把焦点从采用工具转向组织原生重构。
Agency 模式的结构性缺陷是优秀执行者不属于客户团队,随时可能被调走或同时服务多个账号;关键结果需要有人全职为本公司思考。
Every 组建 frontier team,专门持续描绘并试验 AI 能力边界,把前沿探索从个人兴趣变成明确的组织职能。
Cowork 团队直接招募企业财务与会计用户做屏幕共享访谈,说明通用 Agent 的落地仍要回到具体岗位工作流。