AInews / 004

资深开发者用 AI 完成 issue 多花 19% 时间,事后仍以为自己快了 20%

· 判断带宽 代码审查 自动化反讽

16 名资深开源开发者在自己的仓库里用 AI 修 246 个真实 issue,墙钟时间大约多花 19%,事后仍以为自己快了 20%。真正制约系统上限的不仅是代码生成速度,而是被严重透支的人类判断带宽。

2025 年 2 月至 6 月,METR 让 16 名资深开源开发者在各自平均超过 2.2 万星、百万行代码的熟悉仓库里解决 246 个真实 issue。实验采用严格的随机对照设计:一半任务允许使用当时的 AI 工具(主要是 Cursor Pro 和 Claude 3.5/3.7 Sonnet),另一半不允许。最终的秒表计时呈现出意料之外的反转:允许使用 AI 的任务平均多花了 19% 的墙钟时间,聚类置信区间大约在多 2% 到多 39%。更值得警惕的是开发者的主观感知:这批工程师在实验前预期使用 AI 会提速 24%,在实际多耗时 19% 之后,填写问卷时依然认为自己快了 20%。

常见的技术乐观解释往往将此归咎于模型能力尚浅,或是开发者提示词技巧不足。但 METR 在研究论文中明确界定了这一测量边界:这是 2025 年初在「资深工程师、熟悉代码库、且产出必须通过真人严格审查」这一特定象限内的客观快照,并不代表新手入门或探索陌生项目的表现。这项实验的关键分水岭在于完成的定义:它测量的不是 SWE-Bench 那种单次跑通单元测试的自动化通过率,而是代码必须达到项目维护者认可的合并标准,涵盖工程风格、测试覆盖以及架构文档。

这揭示了一个在工具狂欢中被普遍忽视的核心变量:真正制约工程系统上限的,从来不仅是代码生成的速度,而是人类的判断与审核带宽有没有同步扩容。当实验室里的代码补全可以录得 55.8% 的加速,而真实仓库的过审落地却可能出现净减速时,两套时钟衡量的早已不是同一个问题。

测量对象的分叉:短任务完成 vs 真实仓库过审

技术厂商在推广工具时,始终倾向于引用那些最为亮眼的实验数字。

Peng 等人在 2023 年发表的对照实验从 Upwork 招募了 95 名职业程序员,要求他们尽可能快地用 JavaScript 实现一个 HTTP 服务器。在最终完成任务并填写有效问卷的约 35 人中,使用 Copilot 的处理组完成速度提升了 55.8%,95% 置信区间为 21% 至 89%。然而作者在论文中直截了当地声明:这项研究仅测量任务完成时间,并不考察 AI 对代码质量、长期可维护性或潜在缺陷的影响。GitHub 官方博客随后将这一实验简化包装为「生产力提升 55%」的商业叙事。

当进入复杂的企业真实生产环境时,提速的实际数量级迅速收缩。GitHub 与埃森哲(Accenture)合作的企业 RCT记录到的真实变化是:开发者提交的 pull request 数量增加了 8.69%,合并率上升了 15%。官方材料中常被提及的「约 30%」,实质上是开发者对 Copilot 代码建议的采纳率,或是 Azure 调研中员工自评「感觉工作更高效」的主观心理得分,而非经过外部独立审计的净产出乘数。

Google 针对其内部96 名全职工程师进行的严格 RCT显示,AI 辅助带来的速度点估计约为 21%,但置信区间极宽,在部分模型配置下其统计区间甚至包含零。麦肯锡的行业分析图表同样在标题中诚实地写明:生成式 AI 确实能加快基础编码速度,但面对高复杂度的系统级任务时,增益便显著收窄。

两类研究的冲突,根本上源于测量目标(estimand)的彻底分叉:在没有上下文依赖的隔离短任务、自动化断言以及单纯统计 PR 数量时,AI 能够以极高吞吐展示速度;但一旦将标准提升至「资深维护者愿意对长期后果负责并签字过审」,墙钟耗时便可能发生反转。

METR 在2026 年 2 月 24 日发布的后续更新依然未能推翻这一结论。尽管研究人员主观推测 2026 年的模型可能比 2025 年初更有助力,但后续实测数据呈现出严重的信号不可靠性:原队列参与者的点估计依然是速度下降 18%(置信区间 −38% 至 +9%),新招募开发者的点估计为速度下降 4%(置信区间 −15% 至 +9%),两者均跨越零点。更关键的是出现了强烈的选择效应:30% 到 50% 的开发者坦承,在被要求禁用 AI 的对照条件下,他们甚至不愿意提交那些繁重的任务。这篇更新报告的定性是修正实验设计,而非宣布生产力发生翻盘。

感觉更快,为什么会先成为生产力的幻觉

如果主观感受与秒表计时会出现如此强烈的反向背离,那么商业调研中那些整齐漂亮的满意度数据就必须被重新审视。

微软在2026 年《工作趋势指数》(Work Trend Index)中调查了 10 个国家约 2 万名经常使用生成式 AI 的知识工作者。报告将其中 19% 的高频深度使用者划分为「前沿群体」(Frontier)。当被问及在 AI 接管更多基础工作后哪些人类能力更为关键时,50% 的受访者选择了质量控制,46% 选择了批判性思维,同时有 86% 的人声称自己始终将 AI 的输出视为起点并对最终思考负责。然而该报告在数据注释中严谨地注明:所有图表数值均为受访者自评,缺乏客观的遥测数据(telemetry)支撑。

厂商并非看不见判断力正在变得昂贵。微软在报告中明确指出:随着 AI 极大地扩展了人类的行动范围,对于优质判断力的溢价也在同步飙升。OpenAI 则在关于 Harness Engineering 的工程复盘中将矛头直指审查瓶颈:随着代码吞吐量呈几何级数增长,工程系统的核心瓶颈已经转移为人类的质量保证(QA)容量。在这套自述的开发模式中,人类工程师不再逐行审查 pull request,审查工作被大量转交给 Agent 互审。OpenAI 声称 3 名工程师在 5 个月内交付了约 1500 个 PR、100 万行代码,仅耗费传统手写耗时的十分之一。但这仅仅是一份没有对照组、没有公开长期缺陷账本的企业自述,它证明了头部厂商已承认人类审核位正面临物理极限,却并未证明把审核也自动化后系统缺陷率不会悄然累积。

在当下的工程一线,审核过载正演变为一场真实的协作危机,而不仅仅是代码片段质量的好坏。在工程管理者社区的真实讨论中,普遍存在一种抱怨:初级开发者借助 AI 节省了 20 分钟的编码时间,代价却是资深工程师需要花费整整一个小时去逐行排查潜在的幻觉和架构漏洞。当工单本身定义模糊,AI 自动生成庞大 diff,随后评审机器人又自动贴上大量模板化评论时,人类审查者依然不得不耗费巨大心智去猜测其原始意图。

在开源维护者群体中,这一现象体现为更具破坏性的数据畸变。36氪转述开源维护者的统计显示,Voiceflow 维护者收到的 AI 生成 PR 中仅有约十分之一具备合理性,而 cURL 漏洞赏金计划中的有效提交比例则从过去的约六分之一暴跌至二十分之一到三十分之一。工程智能平台 Faros 对约 2.2 万名开发者的系统级追踪数据给出了更刺眼的对比:在代码生成吞吐量大幅上升的同时,每个 PR 相关的线上事故(incident)激增了 242%,并且有 31% 的 PR 最终在没有任何人工审查的情况下被直接合并入主干。当减负演变为「放弃审查」,表面的研发繁荣便直接转化为生产环境的隐性负债。

监控位的负荷位移:四十年前的“自动化反讽”

这种由于下游审查过载而导致系统停滞的结构,绝非大语言模型时代的独特产物。

早在 1983 年,认知心理学家 Lisanne Bainbridge 在其发表于《Automatica》的经典论文《自动化的反讽》(Ironies of Automation)中就深刻指出了这一制度困境:自动化系统的设计初衷原本是为了替代人类的操作与问题解决,但当设计者将所有容易标准化的机械任务全部抽离之后,留给人类的却只剩下无法被算法消解的例外处置与系统监控。这导致了一个经典的悖论:之所以引入自动化,正是因为机器在常规操作上比人类更精准稳定;但系统却依然要求人类操作员时刻保持高度警惕,去监视一个极少发生故障的系统。

Bainbridge 指出,人类的认知生理机制根本无法在缺乏操作反馈的被动状态下,对极低概率发生的异常事件维持长期的有效警戒。将简单易行的操作拿走,不仅不会让复杂任务变得轻松,反而会使操作员在失去上下文手感的同时,面临更陡峭的认知负荷。当系统一旦发生罕见异常需要人工接管时,人类往往需要比全手动时代更高的专业技能与更充足的决策时间,现实环境却往往无法提供这种从容。Barry Strauch 在 2018 年发表于 IEEE 的回顾论文《历经岁月依然悬而未决》中确认,这一人机交互的核心矛盾在半个世纪的工业自动化进程中从未得到真正解决。

将 Bainbridge 的理论框架平移至当下的软件工程,今天开发者所经历的审查过载便不再是零散的抱怨,而是一种必然的结构性位移:AI 能够高效接管的,恰恰是那些连续、可演示、逻辑自洽且容易计数的代码编写工作;而留在人类审查者肩上的,则是代码是否符合业务长远意图、边缘安全风险是否被妥善处理、系统边界是否存在遗漏等离散且高后果的判断任务。这些任务天然不具备连续性,却要求极高的心智带宽,因而最难以被自动化平滑吸收。

关键窗口的制度保护:航空无菌舱与软件合并门

面对类似的高密度信息过载与认知带宽竞争,其他高可靠性行业早在制度层面给出了明确的解法。

现代商业航空业处理高负荷判断的方案,从来不是要求飞行员在复杂环境下强行提升多任务处理能力。美国联邦航空管理局(FAA)在 1981 年正式确立了FAR 121.542 法规(即著名的“无菌驾驶舱规则”,Sterile Cockpit Rule)。该法案强制规定:在滑行、起飞、着陆以及 10,000 英尺以下除巡航之外的所有关键飞行阶段,机组成员严禁从事任何会分散注意力的非必要活动,包括与飞行无关的闲聊或翻阅报刊。这项制度保护的是飞行员在生死关头的情景意识(situational awareness),而非机舱内的礼仪。在东方航空(Eastern Air Lines)212 航班以及佛罗里达航空(Air Florida)90 航班的空难调查中,进近阶段的非必要交谈与注意力分散均被正式认定为导致机组丧失关键高度意识的核心诱因。

然而现代知识工作与软件工程的发展轨迹却走向了完全相反的方向。电子邮件、即时通讯工具以及 ChatOps 将信息的「到达」直接转化为了即时的「响应义务」。Gloria Mark 等人在 2008 年发表于 CHI 的经典研究《打断的代价》中发现:虽然知识工作者在频繁被打断的环境下会通过加快主观处理速度来补偿被占用的时间,导致表面上的任务完成时间并未显著拖长,但这完全是以剧烈上升的主观压力、认知挫败感以及高强度的生理努力为代价的。

持续交付(Continuous Delivery)的概念在随后的演进中也遭遇了局部的异化。Jez Humble 与 Martin Fowler 在确立持续交付的工程定义时,其核心前提始终是建立坚不可摧的自动化验证门禁,确保主干代码时刻处于可安全发布的状态,将软件的可部署性置于堆砌新功能之上。持续交付强调的是在安全验证边界内的快速流动,而非牺牲审查质量的盲目提频。然而在当下的实践中,ChatOps 与 AI 助手的结合,却往往把代码建议、CI 告警、机器人自动化长文与群聊争论一股脑地强行推入代码合并这一极其敏感的决策窗口。

这就引出了一个具体的制度性拷问:在软件工程中,代码合并与生产发布是否应该被视同为飞机的起飞与着陆?如果答案是肯定的,那么在合并窗口内强行引入大量并行的 AI 补全与杂乱的机器人评论,实质上就等同于在飞机进近着陆的无菌窗口强行打开客舱广播。

跨界机制映射:医院警报疲劳与金融闪崩的启示与失效边界

如果将审查过载仅仅理解为「工程师工作不够专注」,就会完全忽视系统性成本究竟被不公正地转移到了谁的身上。

现代医疗系统中的「警报疲劳(Alarm Fatigue)」提供了一个机制上高度同构的解剖样本。在重症监护室(ICU)中,医疗监护设备的默认报警阈值通常被设置得极其敏感和保守,因为从医疗器械厂商到医院管理层,漏报恶性事件所承担的法律责任远高于误报带来的骚扰;而处于床边的护士则是法定的第一响应责任人,却几乎没有权力从制度上调低阈值或关闭警报。

美国医疗机构评审联合委员会(The Joint Commission)在第 50 期《警报安全警讯》(Sentinel Event Alert 50)中统计:在 2009 年 1 月至 2012 年 6 月期间,其哨点事件库共记录了 98 起与警报直接相关的严重医疗事故,其中造成了多达 80 例患者死亡。美国 FDA 的 MAUDE 数据库在 2005 年 1 月至 2010 年 6 月间更是记录了 566 例与警报相关的死亡病例,业内普遍认为这一数字依然存在严重低估。

重症病房内的每名患者每天可能触发数百次警报,其中 85% 到 99% 的报警在临床上完全不需要任何医疗干预。Drew 等人在 2014 年发表于《PLoS ONE》的多中心观察研究中,对 UCSF 的 5 间 ICU 进行了长达 31 天、总计 48,173 监护小时的精密实测:重症病房内的可听警报负荷高达平均每张病床每天 187 次,而在被算法标注的心律失常警报中,假阳性率竟高达 88.8%。因此,国家患者安全目标 NPSG.06.01.01 从 2014 年起强制要求医院推行警报管理规范,其核心解决思路是系统性剔除非必要噪声,而非训练护士以更快的速度去响应每一次误报。

这三组数据虽然统计窗口与分母各异,但指向了完全相同的认知失效机制:当不可操作的噪音信号占据了压倒性的绝对多数,人类大脑唯一的自保响应策略必然是从审慎评估滑向统计层面的习惯性忽略。认知心理学中关于自动化偏差(Automation Bias)的研究进一步证明:当验证过程过于繁琐沉重时,人类操作员极易不假思索地直接选择盲信机器。

金融交易领域在 2010 年 5 月 6 日爆发的「闪崩事件(Flash Crash)」则从另一个维度展现了决策时钟失配的灾难性后果。美国 CFTC 与 SEC 的联合调查报告详细记录了这一过程:自动化大额卖出算法在流动性匮乏的市场中以极高频次强制执行,高频交易算法在短时间内相互抛接筹码,导致部分传统做市商在被迫切回手动交易模式后,根本无法跟上瞬间暴增近十倍的订单流速,市场流动性瞬间蒸发。监管机构随后确立的个股熔断机制,在制度层面上承认了当自动化吞吐超出人类判断承载力时,系统必须建立强制降速的保护阀。

然而,这些跨行业类比在一个关键的物理边界上宣告失效:一次常规的代码错误合并通常不会像医疗事故那样立即危及人类生命,软件系统天然拥有通过确定性自动化测试(如 TDD、纯函数断言与形式化验证)在编译期彻底吸收「正确性」验证的潜在能力

在自动化测试基础设施极其健全的场景下,更快的提交频率与更稳健的系统质量确实能够同时成立。例如在 Faros 2023 年的早期试点中,团队的交付周期下降了 55%,代码首次审查时间同步缩短,测试覆盖率显著上升;埃森哲在 Copilot 实验中也观察到成功构建率提升了 84%。这些来自工业界的正面证据表明:自动化测试能够有效接管机械性的语法与逻辑断言。但它们的有效边界极为分明:机器能够接管断言,却无法代劳架构意图、业务取舍与最终的失败归咎。正如 Graham 与 Cvach 在 2010 年的临床实验中成功将关键警报负荷降低 43% 是依靠重新校准默认阈值而非让护士无休止提速一样,软件工程的解法也必须建立在压降无效干扰之上。

争论双方的最强版本与利益位置

在当下的技术界,关于是否应该在 AI 时代主动保留审查摩擦,正在形成两种立场鲜明且各有依据的阵营。

摩擦与节奏把关派(Friction & Cadence Gatekeepers)的核心主张并非保守主义的道德劝诫。该派别指出:在必须由人类承担最终系统失败责任的关键窗口内,未加约束的生成加速必然会将巨大的隐性认知负荷转嫁为下游的长期维护债务。这一立场保护的是代码审查者、开源维护者以及生产系统的终端用户。其依据的观察窗口是真实场景下的墙钟耗时、过审标准、无审查合并率以及生产故障密度。METR 测得的「主观加速与客观减速的反差」、开源维护者面临的低质 PR 洪流,以及 Faros 揭示的线上事故率上升,构成了这一派最坚实的事实底座。促使该派别修正判断的新证据应当是:在严格要求真人过审的高星级成熟仓库中,出现第二项独立的实测研究能够稳定证明开发者的真实墙钟耗时显著下降,且系统的线上缺陷率未发生反弹。

自主提速与 Agent 委派派(Autonomous Velocity & Agent Offloading)的最强论据同样不容轻视。该流派认为:METR 设定的实验象限过于狭窄且苛刻;对于探索性原型、低风险内部工具以及标准化的胶水代码,AI 确实展现出了颠覆性的提速效果。他们主张,传统由人类工程师逐行肉眼 review 的流程本身就是手动打字时代的低效遗留;通过建设高覆盖率的自动化评测集、分级审批机制以及让 Agent 相互进行交叉审查,完全可以将人类从繁琐的纠错细节中解放出来,专注于最高层级的意图输入。OpenAI 在 Harness Engineering 中将 QA 瓶颈转交给自动化测试沙箱与模型互审,正是这一逻辑的极致体现。促使该流派修正判断的新证据应当是:真实企业数据显示无审查合并导致生产故障持续失控,或者模型互审被证实只能单向推高代码采纳率却无法有效拦截隐蔽的逻辑缺陷。

对这两派的比较,应当立足于客观的系统属性,而非空泛的站队:

  1. 速度维度:在纯粹的代码生成与初稿拼装侧,AI 工具已经取得了压倒性胜利;而在端到端的系统落地侧,速度依然受制于验证标准的严苛程度。
  2. 可靠性维度:取决于完成的定义是停留在「单次运行通过」,还是延伸至「长期生产免于回滚」。
  3. 控制权与权力位置:当前的审查者与维护者往往处于极度被动的防御地位,他们几乎没有权限去主动压低上游 AI 的代码生成速率,正如 ICU 护士缺乏权力调低监护仪的报警敏感度一样。
  4. 失败责任的归属:社会学家 Madeleine Elish 将此精准地定义为「道德溃缩区」(Moral Crumple Zone):在复杂的人机协作系统中,当高度自动化的流程引发灾难性事故时,处于末端、实际控制权极度受限的人类操作员往往被迫充当吸收责任与惩罚的缓冲区。欧盟《人工智能法案》(EU AI Act)第 14 条在法律层面强制要求高风险系统的监督者必须具备识别过度依赖(Automation Bias)的能力并享有随时停机的权力,正是为了防止形式化的人在回路演变为事实上的免责道具。

这正是对文章开篇那 19% 减速之谜的最终回答:它并不是在宣告 AI 编程工具的破产,而是在用冰冷的数据提醒整个行业:当最终的质量门槛依然要求人类工程师为生产安全签字画押时,人类的判断带宽绝不会仅仅因为代码生成快了十倍而凭空暴涨。

航空业依靠立法确立的无菌驾驶舱来捍卫起飞与着陆的安全,医疗系统依靠系统性调降警报阈值来守护护士的精力,金融市场依靠熔断机制来抵御算法超速对流动性的抽干,而持续交付的先驱们也早在工程宪章中写明了安全门禁对于速度的绝对优先权。商业宣传往往只热衷于兜售加速的上半句,却刻意剪掉了守护系统可靠性所必须付出的下半句代价。

尾声与未来 6 到 12 个月的检验信号

当软件研发的瓶颈全面从「写不出代码」转移至「审不完意图」时,重新设计组织的决策节奏与判断窗口,便成了区分玩具演示与工业级生产系统的分水岭。

在未来的 6 到 12 个月内,有三个具体的观察信号能够直接检验这一领域的演进方向:

  1. 真实独立计时的复现:在资深工程师、熟悉仓库且要求严格人工过审的实验设定下,是否会出现第二项具备公信力的独立计时研究,其测量符号是否依然呈现为耗时反增。
  2. 事故密度与无审查合并的关联走向:在更广泛的企业生产遥测中,不经人工审查直接合并代码的比例,以及每个 PR 带来的线上事故发生率,是否会随着 AI 生成吞吐量的持续攀升而进一步恶化。
  3. 关键决策窗口的制度重塑:领先的技术团队究竟是开始为核心模块的代码合并与生产发布设立严禁外界干扰的「无菌时间窗口」,还是继续激进地将审查权全盘交由 Agent 互审并逐步剥夺人类的最终否决权。

这三个信号无论哪一条在未来被彻底证实或证伪,关于 AI 研发生产力与人类判断带宽的讨论,都将迎来全新的事实基准。