先上数据
我们团队最近在用 AI Agent 跑协作开发。不是那种「让 AI 写个函数」的玩法,是真的把 AI 当成队友,一起提 PR、一起 review、一起上线。
跑了一个多月,攒了 335 个 PR。我把数据按阶段拆了一下,结果越看越觉得,这事跟网上说的完全不一样。

口径说明,按 PR 创建时间归属阶段,Lead Time 取已合并 PR 的中位数。CI 是 workflow elapsed minutes,不是最终账单分钟。

阶段一:人工分工期,4 分钟的蜜月
人工分工期,77 个 PR,平均 4 分钟搞定。返工率 3.9%。
这个阶段就四个字,蜜月期。
一个人拆任务,一个人 review,AI 只管写代码。速度快得离谱,但也乱得离谱。没有规范,没有 check,AI 写的东西靠人肉眼扫一遍就合。
3.9% 的返工率看起来还行,其实是因为人根本没细查。
阶段二:纪律建制期,速度暴跌 7 倍
然后到了纪律建制期,75 个 PR,周期从 4 分钟暴涨到 29 分钟。返工率还升到了 5.3%。
我当时就纳闷了,立规矩不是为了让质量变好吗,怎么速度暴跌 7 倍,返工率还上去了?
后来想明白了。标准变严了,以前「差不多就行」的 PR,现在被打回来了。数据上不好看,但质量其实在往上走。
这就像你突然开始健身,头两周体重可能还涨了,因为肌肉在充血。不是坏事,是身体在适应。
阶段三:机器化期,Token 账单飞起来
再往后,机器化期,107 个 PR,样本量最大。周期回落到 27 分钟,返工率降到 3.7%。但 Token 消耗飙到了 29.3M/PR。
这个阶段的核心变化是,AI 开始自己跑流水线了。人类从指挥者退到监督者,重复性工作交给 Agent 自动完成。
效率回来了,但 Token 烧得吓人。29.3M token 一个 PR,按当时的模型价格,每个 PR 的推理成本已经不可忽视。
我当时就有一种感觉,这像是在雇一个特别勤快的实习生。活儿干得快,但咖啡钱(token 钱)得你自己掏。
阶段四:状态闭环期,返工率翻了三倍
然后,状态闭环期。31 个 PR,周期 22 分钟,返工率 12.9%。
这是整组数据里最反常的一段。返工率比前面任何阶段都高。
我当时看到 12.9% 这个数字,直接愣住了。前面跑那么顺,怎么突然翻了三倍多?
复盘之后发现,这个阶段我们在做状态同步,让 AI Agent 之间能互相感知进度、共享上下文。但不同 Agent 的上下文理解有偏差,一个 Agent 改的东西,另一个 Agent 看不懂,反复打回。
坦率的讲,多 Agent 协作的通信协议没建好,返工率就炸了。
阶段五:高保障治理期,零返工但周期翻倍
再到高保障治理期。36 个 PR,周期 77 分钟,返工率 0%。CI 成本 9.9 分钟/PR,Token 降到 1.6M。
没有一笔 PR 被返工,但每个 PR 的周期从 27 分钟涨到了 77 分钟。
更隐蔽的是 CI 成本。9.9 分钟/PR 的 workflow elapsed time,意味着服务器资源在持续燃烧。
坦率的讲,这个阶段我有点慌。质量是上来了,但速度是不是被牺牲太多了?
质量保障和开发速度,真的是此消彼长的吗?
阶段六:成本反噬期,用更便宜的方式做对的事
最后到了成本反噬期。只有 9 个 PR,样本太少,不能做统计结论。但我注意到一个趋势,CI 成本突然降到 2.9 分钟/PR,不到高保障期的三分之一。
这说明团队在优化基础设施。可能是缓存命中,可能是任务裁剪,可能是模型降级。
用更便宜的方式,维持同样的质量。这才是正确的方向。
先保证对的事情,再把对的事情做便宜。
洞察一:路径演变是一条 U 型曲线
跑了这 335 个 PR 之后,我对两件事的理解变深了。
第一件,路径演变不是一条直线,是一条 U 型曲线。
你想想,人工分工期 4 分钟一个 PR,然后纪律建制期暴跌到 29 分钟,机器化期又回升到 27 分钟,状态闭环期 22 分钟看着在变好,结果返工率炸了,高保障期直接干到 77 分钟。
一直到成本反噬期,CI 压到 2.9 分钟,质量还在线,这才算是找到了一个相对稳定的状态。
整个过程,快→慢→快→乱→更慢→稳。不是谁做得不好,是这个演进路径本来就这样。
很多团队死在第三阶段或第四阶段。机器化期看着效率回来了,以为可以放量了,结果 Token 账单飞起来。状态闭环期返工率炸了,团队信心受挫,有人就想回退到人工分工。
我的感觉是,这条曲线你得提前知道,不然每个波动你都会以为是自己做错了。
洞察二:成本有三条腿,各阶段重新分配
第二件,成本有三条腿,每个阶段这三条腿在重新分配。
第一条腿,Token 消耗,也就是推理成本。机器化期 29.3M/PR,高保障期降到 1.6M/PR,差了将近 20 倍。
第二条腿,CI 分钟,也就是基础设施成本。高保障期 9.9 分钟/PR,成本反噬期压到 2.9 分钟,靠的是缓存命中和任务裁剪。
第三条腿,最容易被忽略,人力时间。人工分工期 4 分钟一个 PR,但人得全程盯着。高保障期 77 分钟一个 PR,但人基本不用管了,机器在跑。
所以成本不是单算的。机器化期 Token 最贵,但人省下来了。高保障期周期最长,但零返工意味着没有隐性返工成本。
关键问题是,你当前阶段最缺的是什么?是时间、是钱、还是质量?选策略的时候,得先看清楚自己缺哪条腿。
那个 12.9% 的返工率,是一个相变信号
还有一个点我觉得挺值得单独拿出来说的。
状态闭环期返工率飙到 12.9%,不是因为质量变差了,是因为协作复杂度上了一个台阶。单 Agent 到多 Agent,通信协议没建好,上下文对不上,自然互相踩脚。
这个 12.9% 是一个信号,不是失败。它告诉你,系统正在经历一个相变,从单点自动化过渡到网络化协作。这个阶段最危险的做法是往回缩,回到机器化期的模式。最正确的做法是穿过去,把通信协议建好,然后进入高保障治理。
很多企业做 Agent 落地的时候,恰恰卡在这里。试点阶段跑得挺好,一放量就乱,然后团队就说 AI 不靠谱,还是人来做吧。其实不是因为 AI 不靠谱,是因为你没走完这个相变。
给企业 Agent 落地的建议
说到这个,我想起一个挺常见的问题。
很多客户一上来就问,上 AI Agent 能省多少人力成本?
这组数据告诉我,真正的答案不是省了 30% 还是 50%,而是你愿不愿意先接受一段效率下降、成本上升的调整期。
从人工分工到机器化,我们花了将近 200 个 PR 才跑顺。中间有纪律建制的阵痛,有多 Agent 协作的混乱,有质量保障的代价。
如果你是一家电商公司,正在考虑用 AI Agent 接管客服、供应链、内容生成,我的建议是,前 100 个任务别算 ROI,算学习曲线。100 到 300 个任务,关注返工率和协作摩擦,这是优化空间。300 个任务以后,才开始谈降本增效,因为那时候你的流程才真正跑通了。
AI Agent 不是开关,一按就有效果。它是一个需要养的系统,养规范、养协作、养数据。
有类似问题想聊聊?扫码加微信,备注「Agent咨询」。