AgentBuilder
返回洞察列表
AI Agent开发效率数据复盘

我跑了 335 个 AI Agent 协作 PR,结果跟我想象的完全不一样

2026-08-085 分钟

先上数据

我们团队最近在用 AI Agent 跑协作开发。不是那种「让 AI 写个函数」的玩法,是真的把 AI 当成队友,一起提 PR、一起 review、一起上线。

跑了一个多月,攒了 335 个 PR。我把数据按阶段拆了一下,结果越看越觉得,这事跟网上说的完全不一样。

AI Agent 协作开发的6个阶段演进

阶段PR 样本PR 周期 P50返工率CI 分钟/PRToken/PR |---|---|---|---|---|---| 人工分工期774 分钟3.9%—— 纪律建制期7529 分钟5.3%—— 机器化期10727 分钟3.7%—29.3M 状态闭环期3122 分钟12.9%5.35.4M 高保障治理期3677 分钟0%9.91.6M 成本反噬期973 分钟0%2.9—

口径说明,按 PR 创建时间归属阶段,Lead Time 取已合并 PR 的中位数。CI 是 workflow elapsed minutes,不是最终账单分钟。

335个PR的6阶段数据复盘

阶段一:人工分工期,4 分钟的蜜月

人工分工期,77 个 PR,平均 4 分钟搞定。返工率 3.9%。

这个阶段就四个字,蜜月期。

一个人拆任务,一个人 review,AI 只管写代码。速度快得离谱,但也乱得离谱。没有规范,没有 check,AI 写的东西靠人肉眼扫一遍就合。

3.9% 的返工率看起来还行,其实是因为人根本没细查。

阶段二:纪律建制期,速度暴跌 7 倍

然后到了纪律建制期,75 个 PR,周期从 4 分钟暴涨到 29 分钟。返工率还升到了 5.3%。

我当时就纳闷了,立规矩不是为了让质量变好吗,怎么速度暴跌 7 倍,返工率还上去了?

后来想明白了。标准变严了,以前「差不多就行」的 PR,现在被打回来了。数据上不好看,但质量其实在往上走。

这就像你突然开始健身,头两周体重可能还涨了,因为肌肉在充血。不是坏事,是身体在适应。

阶段三:机器化期,Token 账单飞起来

再往后,机器化期,107 个 PR,样本量最大。周期回落到 27 分钟,返工率降到 3.7%。但 Token 消耗飙到了 29.3M/PR。

这个阶段的核心变化是,AI 开始自己跑流水线了。人类从指挥者退到监督者,重复性工作交给 Agent 自动完成。

效率回来了,但 Token 烧得吓人。29.3M token 一个 PR,按当时的模型价格,每个 PR 的推理成本已经不可忽视。

我当时就有一种感觉,这像是在雇一个特别勤快的实习生。活儿干得快,但咖啡钱(token 钱)得你自己掏。

阶段四:状态闭环期,返工率翻了三倍

然后,状态闭环期。31 个 PR,周期 22 分钟,返工率 12.9%。

这是整组数据里最反常的一段。返工率比前面任何阶段都高。

我当时看到 12.9% 这个数字,直接愣住了。前面跑那么顺,怎么突然翻了三倍多?

复盘之后发现,这个阶段我们在做状态同步,让 AI Agent 之间能互相感知进度、共享上下文。但不同 Agent 的上下文理解有偏差,一个 Agent 改的东西,另一个 Agent 看不懂,反复打回。

坦率的讲,多 Agent 协作的通信协议没建好,返工率就炸了。

阶段五:高保障治理期,零返工但周期翻倍

再到高保障治理期。36 个 PR,周期 77 分钟,返工率 0%。CI 成本 9.9 分钟/PR,Token 降到 1.6M。

没有一笔 PR 被返工,但每个 PR 的周期从 27 分钟涨到了 77 分钟。

更隐蔽的是 CI 成本。9.9 分钟/PR 的 workflow elapsed time,意味着服务器资源在持续燃烧。

坦率的讲,这个阶段我有点慌。质量是上来了,但速度是不是被牺牲太多了?

质量保障和开发速度,真的是此消彼长的吗?

阶段六:成本反噬期,用更便宜的方式做对的事

最后到了成本反噬期。只有 9 个 PR,样本太少,不能做统计结论。但我注意到一个趋势,CI 成本突然降到 2.9 分钟/PR,不到高保障期的三分之一。

这说明团队在优化基础设施。可能是缓存命中,可能是任务裁剪,可能是模型降级。

用更便宜的方式,维持同样的质量。这才是正确的方向。

先保证对的事情,再把对的事情做便宜。

洞察一:路径演变是一条 U 型曲线

跑了这 335 个 PR 之后,我对两件事的理解变深了。

第一件,路径演变不是一条直线,是一条 U 型曲线。

你想想,人工分工期 4 分钟一个 PR,然后纪律建制期暴跌到 29 分钟,机器化期又回升到 27 分钟,状态闭环期 22 分钟看着在变好,结果返工率炸了,高保障期直接干到 77 分钟。

一直到成本反噬期,CI 压到 2.9 分钟,质量还在线,这才算是找到了一个相对稳定的状态。

整个过程,快→慢→快→乱→更慢→稳。不是谁做得不好,是这个演进路径本来就这样。

很多团队死在第三阶段或第四阶段。机器化期看着效率回来了,以为可以放量了,结果 Token 账单飞起来。状态闭环期返工率炸了,团队信心受挫,有人就想回退到人工分工。

我的感觉是,这条曲线你得提前知道,不然每个波动你都会以为是自己做错了。

洞察二:成本有三条腿,各阶段重新分配

第二件,成本有三条腿,每个阶段这三条腿在重新分配。

第一条腿,Token 消耗,也就是推理成本。机器化期 29.3M/PR,高保障期降到 1.6M/PR,差了将近 20 倍。

第二条腿,CI 分钟,也就是基础设施成本。高保障期 9.9 分钟/PR,成本反噬期压到 2.9 分钟,靠的是缓存命中和任务裁剪。

第三条腿,最容易被忽略,人力时间。人工分工期 4 分钟一个 PR,但人得全程盯着。高保障期 77 分钟一个 PR,但人基本不用管了,机器在跑。

所以成本不是单算的。机器化期 Token 最贵,但人省下来了。高保障期周期最长,但零返工意味着没有隐性返工成本。

关键问题是,你当前阶段最缺的是什么?是时间、是钱、还是质量?选策略的时候,得先看清楚自己缺哪条腿。

那个 12.9% 的返工率,是一个相变信号

还有一个点我觉得挺值得单独拿出来说的。

状态闭环期返工率飙到 12.9%,不是因为质量变差了,是因为协作复杂度上了一个台阶。单 Agent 到多 Agent,通信协议没建好,上下文对不上,自然互相踩脚。

这个 12.9% 是一个信号,不是失败。它告诉你,系统正在经历一个相变,从单点自动化过渡到网络化协作。这个阶段最危险的做法是往回缩,回到机器化期的模式。最正确的做法是穿过去,把通信协议建好,然后进入高保障治理。

很多企业做 Agent 落地的时候,恰恰卡在这里。试点阶段跑得挺好,一放量就乱,然后团队就说 AI 不靠谱,还是人来做吧。其实不是因为 AI 不靠谱,是因为你没走完这个相变。

给企业 Agent 落地的建议

说到这个,我想起一个挺常见的问题。

很多客户一上来就问,上 AI Agent 能省多少人力成本?

这组数据告诉我,真正的答案不是省了 30% 还是 50%,而是你愿不愿意先接受一段效率下降、成本上升的调整期。

从人工分工到机器化,我们花了将近 200 个 PR 才跑顺。中间有纪律建制的阵痛,有多 Agent 协作的混乱,有质量保障的代价。

如果你是一家电商公司,正在考虑用 AI Agent 接管客服、供应链、内容生成,我的建议是,前 100 个任务别算 ROI,算学习曲线。100 到 300 个任务,关注返工率和协作摩擦,这是优化空间。300 个任务以后,才开始谈降本增效,因为那时候你的流程才真正跑通了。

AI Agent 不是开关,一按就有效果。它是一个需要养的系统,养规范、养协作、养数据。

有类似问题想聊聊?扫码加微信,备注「Agent咨询」。

有类似问题想聊聊?

扫码加微信,备注「Agent咨询」,第一次沟通免费

预约 1 对 1 免费诊断