前两天,我在群里看到一句话:造车的人声量更大,开车的人经验更有用。
这句话很抓人。我越想却越觉得奇怪。既然大家都知道开车比造车重要,为什么每天刷到的还是新 Agent、新 workflow、新产品,还有各种“我用 AI 把这件事做出来了”?为什么真实使用才决定一个东西有没有价值,我们看到的却总是它第一次跑通的样子?
再回头看看我自己的个人网站,其实也差不多。我做过不少小工具、Agent 和自动化任务。第一次跑通的时候最兴奋,也最容易写:问题是什么,我怎么做,最后出来了什么。可三个月之后它还在不在运行,中间人工救过多少次,需求变了以后有没有继续改,这些东西我很少回来补一篇。
我一边觉得外面的讨论太像车展,一边也在把自己的个人网站做成车展。
造车天然适合发出来
做出一个新东西,故事非常完整。有明确的问题,有解决方案,有截图,有视频,最好再来一个前后对比。哪怕读者不了解技术,几秒钟也能看懂价值。
群里有人分享 AI 游泳教练,分析一段训练视频,给出动作建议。也有人给孩子做墨水屏设备,把音乐和时间规则放进家庭日常。这些东西当然有价值,而且“第一次做出来”本身就值得分享。
但第一次成功,只回答了“它能不能做”。真正上路以后,问题才变成“它能不能一直做”。
游泳教练到了第二十次课还在用吗?水下光线一变,建议还准不准?孩子三个月后还看不看那块墨水屏?家里的规则改了,代码由谁继续维护?
这些问题没有揭幕时刻。它们散落在一次次使用里,表现为偶尔多核一遍、临时补一个逻辑、连接失效后重新配置,或者某一天开始就不再用了。没有人会专门截一张图,说这个 Agent 今天又稳定完成了第一百次任务。更少有人会发一条消息,说我折腾了两个月,最后决定放弃。
所以我们每天看到的 AI 进展,并不是现实使用的随机样本。传播天然会留下那些容易展示的第一次成功,把长期的摩擦、维护和安静放弃漏掉。
我们看到的是最高时速,不是行驶里程。
试过一次,离用进工作还很远
一项持续六个月的 NBER Copilot 现场实验很能说明这个差别。研究覆盖 66 家企业和 7137 名知识工作者,超过 90% 的人至少使用过一次 Copilot。只看到这个数字,很容易得出“AI 已经进入工作”的结论。
但研究者没有在第一次使用后就停止观察。十二周以后,每周使用者稳定在处理组的不足 40%。第四到第六个月,只有 5% 的人每周都用,20% 一次也没用。
90% 和 5% 不是同一个统计口径,不能简单写成采用率暴跌。但这个差别本身已经说明问题:试过一次,和真正用进日常工作,中间隔着很长一段路。
实验也不是说 AI 没用。实际使用的人每周少花了大约两小时处理邮件。问题在于,处理自己的收件箱,一个人就能改变;会议、协作文档、数据口径和组织流程,需要一群人一起动。模型能力可以在一次演示里突然向前跳,真实采用却要等习惯、流程和责任慢慢跟上。
我自己做工具时也有类似体感。第一次跑通,最难的是把功能做出来。等它真的开始反复运行,主要工作就变成了另一套东西:输入变了怎么办,外部系统变了怎么办,模型更新以后结果漂了怎么办,原来知道怎么补救的人不在了怎么办。
这些才是开车的经验。但它们太碎、太慢,也太不体面,所以很少进入公开讨论。
个人网站不该只有新车发布会
我之前写过《AI 时代,失败比成功更值得记录》。那时我想说,失败样本比成功故事更有信息量。现在再往前想一步,失败和长期摩擦之所以稀缺,不只是因为大家报喜不报忧,也因为它们不适合传播。
第一次跑通可以压缩成一分钟视频。一个工具三个月里如何被反复修补、逐渐稳定,或者慢慢没人再用,很难压缩成一个高光时刻。
这也让我重新想了一下个人网站的价值。
记录第一次做出来当然没有问题。问题是,如果只记录这一刻,几年以后回头看,留下来的就只是一排新车,没有一张里程表。
以后除了写“我做出了什么”,我更应该回来补几件事:它现在还在不在运行,完成了多少真实任务,需要多少人工干预,最后如果停了,又是为什么停。
个人网站不只是展示我会造什么,也应该留下我真正开过什么。
一辆车有没有价值,不看它发布时围了多少人,要看第一百次任务时,它还在不在路上。