随笔 / AI 与 思考

最近就“主动智能”的几点思考

· AI/Agent 主动智能 产品思考

从空白输入框到准备好的下一步:当 AI 的执行能力越来越强,产品需要感知现场状态、识别关键缺口,并把证据与方案组织成可供人判断的决策支架。

最近几件事撞到一起,让我重新认真看待“主动智能”。

一两周前,我和一位理财平台的业务负责人吃午饭。聊到 AI 产品落地时,他提到,现在不少产品还是聊天机器人的思路:摆一个输入框,等用户提出问题,再由 AI 回答。

他觉得这个方向不太对。

相比等用户开口,他更希望 AI 能增加供给,主动为不同用户提供更个性化的选择。

这句话我当时就觉得有道理。回来之后,我们在数据类 Agent 上也做了一些尝试,不再只摆着一个空白输入框等用户提问,而是开始主动推荐一些值得分析的问题。

紧接着,我最近用 Codex 时,注意到聊天框上方每天会出现两三个建议任务。

这些建议不是泛泛地问我要不要继续优化代码,而是明显结合了当前项目的状态:哪些文件改了一半,哪些功能已经起了头,哪些测试还没有补,哪些事情顺手往前推一步就能形成闭环。

点击其中一条,系统会展开成一段两三百字的完整 prompt。目标、相关文件、预期动作和验收方式,基本都已经组织好了。我扫一眼,没有明显问题,就可以直接让它继续跑。

前两天,课代表又在群里重发了一期很早以前的 YouTube 视频。大概一年前第一次看时,里面提到未来每个人可能都要成为 AI 架构师,也谈到了主动智能。那时没有太多感觉,这次再看,前面两件事情突然在脑子里接上了。

我开始意识到,主动智能可能不只是 AI 产品上的一种交互创新。

当 AI 的执行能力越来越强,人的精力和判断力反而越来越容易被撕碎。主动智能真正需要解决的,也许不是让机器在我没有开口时继续干活,而是帮我从越来越多的可能性里,看见最值得推进的下一步。

空白输入框,把最难的工作留给了用户

今天大多数 AI 产品的核心交互,依然是一个空白输入框。

这个设计看起来足够简单,也足够通用。但仔细想想,它其实把一整套隐形工作推给了用户。

我要先记得自己之前做到了哪里,重新进入任务现场;然后从一堆模糊感受里识别出真正的问题;接着组织背景、补充限制、设计任务边界,最后把这一切写成一段 AI 能听懂的 prompt。

AI 接手的,往往只是最后那段已经被定义清楚的任务。

最困难的部分仍然由人完成:现在究竟应该做什么。

在 AI 能力还比较弱的时候,这个问题没有那么突出。反正大部分事情最终都得人亲手干,想任务和做任务基本连在一起。

但现在不一样了。

代码、调研、数据分析、文档、图片、方案,越来越多任务可以同时交给不同的 Agent。执行开始变便宜,任务启动的速度也越来越快。一个想法刚冒出来,几分钟后就可能已经有了一份报告、一个原型或者一条新分支。

结果是,人并没有自然变轻松。

很多时候,人只是从具体工作的执行者,变成了一个不停恢复现场、编写工单、分发任务、检查结果的调度员。

Agent 可以同时跑十条线,人还是单线程的。

插图:多条并行工作汇聚到一个人面前,执行越快,人的审阅越拥堵。

空白输入框最大的问题,不是它不够智能,而是它默认了一件事:用户永远知道下一步该问什么。

现实显然不是这样。

Codex 替我省掉的,是开工前那十分钟

Codex 最近给我的感受比较特别。

它推荐的任务不一定每一条都值得做,我也不会看到就点。但这些建议经常能抓住一种很具体的状态:事情已经启动了,只是停在了半路。

这种任务最消耗人。

它不像一个全新的需求,可以从头认真规划;也不像已经完成的工作,可以直接放下。它横在工作区里,需要我重新打开文件、查看 diff、回忆前面的思路,再判断接下来应该补测试、修边界,还是干脆回退。

真正写代码可能只需要十分钟,重新进入现场却可能先耗掉十分钟。

Codex 的建议,本质上是在替我完成这段开工前的脑力准备。

它先观察现有工作,识别哪些东西没有收尾,再把其中一件组织成相对完整的任务。最后那一下点击仍然留给我,但我面对的已经不是一个空白输入框,而是一个准备好的下一步。

这和传统的相关推荐不太一样。

内容平台根据历史点击,推荐一篇我可能喜欢的文章;电商平台根据浏览记录,推荐一件我可能购买的商品。这类推荐主要是在猜我的偏好。

Codex 更像是在判断一件事有没有向前推进的条件。

它不是在问我喜欢什么,而是在看:我正在做什么,做到哪里了,现在往前走哪一步最顺。

这可能是主动智能最有价值的一种形态。

它没有抢走任务的决定权,却接手了任务形成之前那段零散、重复又容易被遗漏的思考。

模型在追求 RSI,产品却还停在手摇时代

最近大模型领域的讨论,几乎被同一个词垄断了:RSI(Recursive Self-Improvement,递归自我改进)。

从强化学习、推理时间扩展(test-time compute),到自博弈与自合成数据,底层实验室所有的算力与野心,都在试图攻克同一个关口:怎么让模型摆脱对人类低速标注的依赖,在自己的闭环里发现问题、自我验证、自我提升。

模型侧的共识已经非常清晰:如果智能的跃迁必须依赖人类一口一口喂数据,那它的天花板就永远受制于人类的生理带宽。

但转过头来看 AI 产品,却能看到一种极其刺眼的撕裂。

当底层的模型正在不分昼夜地尝试自我进化时,上层的 AI 产品,主流形态却依然死死停留在十年前:摆一个空荡荡的聊天框,等待一个人在键盘前敲下回车。

这就像给一辆装配了自主引擎的现代赛车,硬生生接上了一根必须纯靠人力去摇的手动摇把。

插图:动力强劲的赛车仍要等人摇动启动把手,产品被人的输入卡住。

只要人不开口,系统就陷入绝对的静止。哪怕底层的推理能力再强,只要用户在几百个标签页、未读消息和上下文碎片里稍一走神,AI 的价值就直接清零。

如果说在模型训练层,RSI 解决的是“智能如何脱离人类喂养的线性瓶颈,实现能力的自我提升”;那么在 AI 产品层,主动智能要解决的,正是“价值如何脱离人类输入的线性瓶颈,实现能力的自主交付”。

这是 AI 时代走到当下,产品层面最该关注的破局点。

一个真正具备生命力的 AI 产品,绝不该继续甘当一个等候吩咐的被动应答器,而必须学会主动走到现场。

主动智能的核心之一:从对话框走向现场状态

很多人谈到主动智能,容易立刻联想到更频繁的推送、更智能的弹窗,或者某种无休止的自动化脚本。

如果理解停留在这一层,主动智能就只会退化成另一种形态的信息骚扰。

主动智能的第一个真正核心,是环境感知与状态对齐(State Awareness)

被动产品只活在用户按下发送键的那一瞬间。在那之前,它对真实世界正在发生什么一无所知,只能依靠用户在 Prompt 里艰难地还原前因后果。

但真实的工作从来不是发生在输入框里的。它发生在 Git 仓库未提交的改动里,发生在昨天下跌的业务转化率报表里,发生在正在报警的线上服务链路里,发生在写了一半、由于被打断而搁置了三天的文档里。

Codex 之所以能给出令人信服的建议,关键就在于它挂载在代码环境之中。它不是去猜我喜欢什么,而是切实“看”到了当前代码库的物理状态:哪些类型报错还在悬空,哪个接口定义好了却缺乏对应的测试用例。

真正有价值的私有上下文,从来不是静态塞进知识库的一堆文档,而是在正确时机能被感知到的工作现场状态。

没有对物理环境的常态化感知,主动就是盲人摸象;只有当 AI 产品真正常驻在环境之中,它的主动性才可能具备合理立足的锚点。

主动智能的核心之二:识别系统的缺口与演进张力

感知到了状态,是否就意味着可以无节制地替用户干活?

显然不是。

这也是为什么早期一些尝试“后台自动执行任务”的产品最终让人厌烦。系统捕获到几个关键词,就开始在后台轰隆隆地跑出一堆无关紧要的结果,最后全塞给用户阅读。这种做法不仅没有减轻负担,反而在成倍制造“注意力负债”。

这就引出了主动智能的第二个核心:识别系统的演进张力与关键缺口(Gap Detection)

在复杂系统里,并不是每一件事都值得立即推进。绝大多数琐碎的波动,最好的处理方式就是让它安静地留在背景里。

主动智能需要具备一种极其敏锐的“缺口识别能力”:

回到模型训练的 RSI 来看,自我改进之所以能转得起来,前提是系统拥有一个可靠的验证器(Verifier),能判断哪一步走通了、哪一步走错了。

AI 产品上的主动智能同样如此。系统必须能够评估任务演进的成熟度:知道哪些事情条件已经具备,只差临门一脚;知道哪些分叉现在推一把,就能让后面的一连串动作顺理成章地闭环。

它不是在凭空创造新任务,而是在帮人发现那些呼之欲出、却被琐事掩埋的断点。

插图:助手发现桥面仅缺一块木板,把现成木板带到断点,打通后续道路。

主动智能的核心之三:交付决策支架,而不是抛出开放问题

即便识别出了缺口,产品也不应该简单地把问题原样踢回给用户。

我们在做数据 Agent 时踩过这个坑:系统检测到底层数据异常,就主动弹出一句提示:“发现昨日转化率波动,要不要分析一下?”

这表面上是主动,实际上依然把最繁重的思考留给了人。用户还得去想:这个波动到底大不大?跟渠道有关还是跟版本有关?我应该用什么口径去查?查完了我能拿它怎么办?

主动智能的第三个核心,是交付前置压缩的决策支架(Decision Staging)

在用户被唤醒的那一刻,AI 应该已经默默完成了 90% 的脏活累活:多源数据的抽取、异常链路的交叉对比、边界条件的排查、可选方案的推演以及潜在代价的计算。

递到用户面前的,不该是一个空泛的疑问句,而应该是一个准备就绪的判断单元:

结构可以外包,繁重的中间过程可以外包,但最终的方向裁决与判断主权,必须完整地交还给人。

插图:助手先整理证据和两条路线,人拿着方案在岔路口作最后选择。

用户面对的不再是一片混沌的现场,而是一道选项清晰、代价明确的单选题。他只需要负责最关键的审阅与拍板。

这才是主动智能与被动工具之间真正的分水岭:被动工具等候命令,主动智能把复杂的现实预先打磨成可以决断的形态。

AI 产品的复利,来自主动闭环的能力

回顾 AI 走过的这几年,模型的智力密度正在以肉眼可见的速度膨胀。从最初的文本续写,到后来的复杂推理、工具调用,再到今天行业全力冲刺的 RSI 自我迭代。

但在产品的这一侧,我们的交互框架却远远没有跟上这种膨胀。

面对越来越强的算力,如果我们的产品依然只能靠人的主动性去单点触发,那么人终究会被无休止的任务分发、上下文找回和中间结果的审核彻底压垮。

模型的自进化固然激动人心,但它不能替代产品形态的自我革新。

对于底层的模型训练,核心战场在 RSI,看谁能更早跑通机器自我进化的正循环; 而对于上层的 AI 产品,核心战场必定在主动智能,看谁能率先摆脱空白输入框的束缚,把澎湃的模型算力转化为常态化的工作流推进力。

最好的主动智能,平时像空气一样安静地感知着系统的每一个运转细节。

它不抢功,不添乱,不大惊小怪。

直到系统运转到那个真正关键的分叉口,它才把梳理好的脉络、证据与就绪的方案递到你的手边。

那一刻,你不再是一个疲于奔命的任务调度员。

你终于可以把最为稀缺的判断力,稳稳地落在最该落下的地方。

订阅 / 联系

下一篇继续从这里接上

新文章会同步到 RSS;也可以直接发邮件给我。