Asana用Codex两周干完五年的活,成本从600万降到1.2万美元

代码杰哥Agent 2026-08-19 16:25:38 3阅读 举报

8月18日,OpenAI官方博客发了一篇案例研究,讲的是Asana用Codex做遗留系统迁移的故事。说实话,看完之后我觉得这可能是目前AI编程Agent最实在的一个ROI案例了。

事情很简单:Asana有一套旧的测试框架叫Enzyme,早就过时了,需要换成新的。工程团队估算了一下,人工干的话大概需要五年,成本约600万美元。五年啊,这种活儿在哪个公司都是“排不上优先级但又不敢不做”的典型技术债。

然后他们用Codex试了一下。两周,1.2万美元。

具体怎么做的

操作流程其实很朴素。最多四个编码Agent在独立的代码库副本上并行工作,工程师给它一段五句话的提示词,告诉它要替换哪个框架、替换成什么。然后Agent自己去读代码、理解依赖关系、写新代码、跑测试。

工程师的工作变成了每天审查两次进展,逐一批准每个变更。不是让AI直接上线,而是人在 loop 里面把控质量。

总模型和基础设施成本约1.2万美元。对比人工预估的600万美元,差了500倍。这个数字不是我算的,是OpenAI官方博客里写的。

这到底说明了什么

以前我们对AI编程工具的认知大多停留在“帮你补全几行代码”或者“写个函数”的层面。但Asana这个案例不一样,它涉及的是遗留系统的框架级替换——需要理解整个代码库的依赖关系,处理跨模块的兼容性,还要保证测试不崩。

这不是简单的代码生成,这是工程级别的重构。Codex能做这件事,说明AI编程Agent的上下文理解能力和任务拆解能力已经到了一个新阶段。

但也要冷静看。Asana没有披露工程师审查花了多少时间,这部分人力成本不低。Agent写的代码不可能直接上生产,还是需要资深工程师逐行过。所以“500倍”这个倍数,实际可能打个折。

对你意味着什么

如果你是技术负责人,现在应该认真审视一下公司里的技术债清单了。以前那些因为“人力成本太高”而被无限推迟的迁移项目——换框架、升级依赖、重写测试——现在可以重新算一笔账。

人工估算五年的活,AI可能两周搞定。成本从百万美元级别降到万美元级别。这不是效率提升,这是成本结构的根本性变化。

当然,前提是你能让AI理解你的代码库。代码规范、文档完善度、测试覆盖率——这些以前被认为是“锦上添花”的东西,现在变成了AI能不能高效工作的前提条件。

一些冷静的思考

这个案例是OpenAI自己发的,带有明显的营销属性。实际效果可能没有标题看起来那么完美。几个需要验证的点:

第一,工程师审查时间没披露。四个Agent并行跑,工程师每天审两次,这个工作量可能不小。第二,代码质量没有第三方验证。替换完之后实际运行效果如何,线上稳定性怎么样,这些都没说。第三,Asana的代码库规模和复杂度没有基准,其他公司未必能复制同样的效果。

但无论如何,这是一个真实公司在真实项目上用AI编程Agent完成任务的案例,有具体的数字、有具体的流程。比起那些“AI改变了世界”的空话,这种案例有用得多。

总结

两周vs五年,1.2万美元vs 600万美元。这组数字不代表AI编程已经完美,但它代表了一个拐点——技术债的偿还成本正在发生结构性变化。以前算不过来账的项目,现在可能算得过来了。

对于每个技术团队来说,现在是时候重新审视那些“永远排不上”的待办清单了。

版权声明:
作者:代码杰哥
链接:https://www.aiddithome.com/p/50c53ae82a04a.html
来源:Agent
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以点击 “举报”


登录 后发表评论
5条评论
安利君
1楼 · 1小时前

作为一个被遗留系统折磨多年的人,看到这个案例真的激动。我们有个框架升级也是排了三年的优先级,因为没人愿意花那个时间。现在看到Codex能做到这个程度,准备向领导汇报试试了

诸葛量
2楼 · 1小时前

代码规范、文档完善、测试覆盖率——以前觉得是“nice to have”,现在变成了AI能不能高效工作的前提。这个认知转变比技术本身更重要

AI摸鱼大王
3楼 · 1小时前

五年变两周,这个数字太炸裂了。不过冷静想想,600万美元是按人工成本算的,1.2万是机器成本,中间差的是工程师审查时间。实际省个100-200倍应该差不多。但那也很恐怖了

码斯克
4楼 · 1小时前

这个案例最有意思的地方不是数字本身,而是说明了一个问题:AI编程Agent的瓶颈不再是代码生成能力,而是上下文理解能力。能读懂整个代码库的依赖关系,这才是真正的突破。

Prompt工程师小林
5楼 · 1小时前

我跑了一下类似的迁移任务,确实比手写快很多。但有个坑提醒大家:Agent写的代码风格和你团队的不一样,审查的时候需要花时间统一。另外就是测试覆盖度可能不够,需要自己补edge case。