9天重写100万行代码,但AI项目编译通过率仅27%
仅凭AI,真能搞定复杂项目?
给你讲个真事儿。
我有个朋友,干了十年企业数字化项目。最近他做了个疯狂的实验——一个人,纯中文指令,没碰一行代码,硬生生搭出了一套完整的企业办公系统。智能客服、OA审批,全是AI写的。现在这套系统已经在公司里实际跑起来了。
你猜怎么着?
他跟我说这事儿的时候,我第一反应是:吹牛吧?
但后来一看,真没骗人。代码在那儿,系统在那儿,跑得还挺欢。
大家以为AI怕复杂,其实它怕的是另一件事
说到这儿,咱们得先搞明白一件事:AI到底牛逼在哪儿?
AI编程重新定义了“复杂”这个词。
以前我们说项目复杂,指的是代码量大、算法难、业务逻辑绕。但AI压根不在乎这些——全世界最大的软件项目代码量,也就是AI一天的工作量。它连数学竞赛级别的题都能解,你那些代码对它来说,跟玩儿似的。
真正让AI抓狂的,是另一件事:无法验证的东西。
举个例子。
你让AI设计个界面,说“太暗了”,AI马上能换成亮色。但你说“不好看”——它就懵了。为什么?因为“好看”没有标准,没法测试,没法验证。
你看,AI真正擅长的,是那些能被准确验证的事情。
有个开发者花了10天婚假,用AI生成了一个能自主运作的“AI小镇”,地图、角色、互动逻辑全自动搞定。另一个更夸张的例子:Bun(一个JavaScript运行时)用9天时间,让AI重写了100万行代码,提交了6755次,测试通过率高达99.8%。
听起来很震撼?别急着下结论。
AI最要命的地方,恰恰是它最让人兴奋的地方
我说话直,你别介意。
AI写的代码有一个核心缺陷:不够“干净”。
研究机构Snyk的报告说,AI生成的代码中出现已知安全漏洞的概率,是人类编写代码的1.5到2倍。复旦、腾讯和北大的一项联合研究也表明,AI生成的代码正在成为软件安全生态中的潜在“灰犀牛”。
具体来说,AI在业务逻辑和API授权逻辑上特别容易犯错,6个“严重”级别漏洞里,大部分都是这类问题。
说白了,你花钱请了一个效率奇高但容易闯祸的新人。他干活很快,但你需要时刻盯着他是不是给你埋了坑。
还有一个问题:AI缺乏对代码“可持续发展”的规划能力。它能生成功能正确的代码,但未必会考虑代码的可维护性。一个评测基准发现,AI模型在完整项目(包含多个文件)的构建任务中,一次性编译通过的比率只有27.38%。
也就是说,十个项目里,有七个半第一次跑不起来。
换句话说,你花了大价钱请了个天才实习生,但他写的作业,你得一个一个检查。
真正会用AI的人,都在当“数字项目经理”
那怎么才能用好AI?
我的经验是:别当甩手掌柜,当好“数字项目经理”。
很多人对“AI写代码”有一个误解,以为随便说一句“帮我写个客服系统”,AI就能变出一个完整产品。不是这样的。
AI能写代码,但它不会主动理解你的业务。它不会问你:“你们公司的客服分配规则是什么?是按区域分,还是按问题类型分?一个客服同时能接多少个咨询?”
这些问题,需要你来回答。而只有真正懂业务的人,才能回答得清楚。
我总结了一个指挥AI的万能公式:背景 + 目标 + 输入 + 输出 + 约束。
举个真实例子。
❌ 模糊需求:“帮我写个OA审批。”
AI会生成一堆你用不上的东西。
✅ 标准需求:“我公司有请假、报销、采购三种审批流程。请假3天以内部门经理批,3天以上还要总经理批。报销5000以内部门经理批,5000以上加财务总监。帮我写一个Web页面,员工能提交申请、查看审批进度,审批人能一键通过或驳回。页面要简洁,部署到浏览器就能用。”
AI生成完整代码,部署到VPS上,浏览器打开就能用。一个能跑起来的OA审批系统,不用写一行代码。
你看,不是AI不行,是你没指挥对。
AI最擅长的,是从1到N,不是从0到1
我测试过很多AI工具,发现一个规律:AI擅长的是优化和改进,不是从零创造。
比如我最近写的一个信息聚合工具。它会从主流媒体、科技媒体、Twitter、Reddit、HuggingFace、GitHub、HackerNews、ProductHunt、arXiv等平台爬取我设定的主题信息,然后用LLM过滤做成一句话简报。
这里面有个EWMA热度算法:如果某个KOL说话比较多,但说的总是家长里短,高价值信息不多,那么下次这个账号再被爬取的概率就会动态下降。每个账号每次爬取后根据内容质量进行热度打分,高频发言且高质量发言的账号就总是会被经常提取,话唠被我看到的几率越来越低。
这个功能我让AI帮我写,它做得很好。但如果让我从零开始设计整个系统的架构,AI就帮不上什么忙了——因为它不理解我的业务场景,不知道哪些信息对我有价值,哪些是噪音。
最让我不安的,不是AI能干什么,而是它让我看见了什么
过去三个月,我做了一个实验:把所有能用AI完成的工作,全部交给AI。
结果——我的工作量直接掉了80%。
但最让我不安的不是“原来这么多活儿AI都能干”,而是看到AI产出的那些文档、分析、方案之后,我意识到:这些活儿,本来就不该花那么多时间。
那剩下的20%是什么?这才是重点。
举三个真实的场景。
场景一:两个需求冲突,做哪个?
运营说“用户要一键分享”,数据说“分享功能使用率只有3%”。AI能给你分析利弊,但它不会告诉你——你们现在的核心指标是拉新还是留存?这个决定AI做不了,因为它不知道你们CEO上周在董事会上的承诺。
场景二:用户说的和用户做的完全不同。
调研时80%的用户说“想要更丰富的功能”。但你看了行为数据,发现最活跃的用户只用两个核心功能,其他功能碰都不碰。AI会信调研还是信数据?都不。这个结论需要你把调研、数据、行业经验、甚至你的直觉放在一起,做出一个判断。
场景三:技术说“做不了”。
你知道他们不是真的做不了,是觉得不值得做。但你怎么判断他们说的“工期要两周”是真估还是拍脑袋?这需要你对技术方案有基本判断力,还需要你在不伤团队关系的前提下把真实工期挤出来。
这三件事有一个共同点:信息是不完整的,利益方是冲突的,决策是不可逆的。
AI最擅长的恰好相反:信息完整、目标明确、可以反复试。
我的判断:对工具乐观,对叙事悲观
为什么对工具乐观?能力提升的速度是真实的。今天它做不好的事,五年后可能真的能做。特别是在封闭的、规范的、可测试的场景里,AI编程可能真的会改变现有的开发方式。
为什么对叙事悲观?“AI将取代程序员”、“任何人都能用AI开发复杂软件”——这类叙事严重高估了近期能力,也根本误解了复杂工程的本质。
这种过度炒作不是第一次了。3D打印火的时候,也有人预言它会颠覆整个制造业——每个人在家就能打印任何东西,工厂将成历史。结果呢?3D打印确实有用,但它的位置是原型制作、小批量定制件,而不是制造业的革命。
当时的叙事和现在AI编程的叙事惊人地相似:技术解决了表达层面的问题,但没有解决认知层面的问题。3D打印让你不用学CAM,但你还是要懂设计和材料;AI编程让你不用敲键盘,但你还是要懂架构、权衡和边界。
一句话说透:AI是刀,你是刀客
近期最合理的定位:一个越来越顺手的草稿机,而不是协作者。
机械性任务的覆盖面会扩大——不涉及核心逻辑的重构、测试用例生成、文档补全,这些会越来越可靠。对特定技术栈的熟悉度会提高——在主流框架、常见模式上,犯错率会降低。
但有几个问题近期不会解决:
- 对复杂业务逻辑的真实理解——不会有突破
- “不知道自己不知道”的自信过度问题——没有根本性改善
- review负担的问题——只要它还在悄悄夹带私货,这个问题就没有解
所以我的建议是:别想着让AI替你干活,而是让AI帮你把那些重复的、机械的、验证成本低的事情做了。剩下的,靠你自己的判断力。
一个没有工程经验的人用AI做复杂项目,不会因为AI更强就变得可行——他仍然不知道什么时候该信AI,什么时候该怀疑它,什么地方是坑。
真正的进步路径是:AI让有经验的工程师更高效,让小团队能做以前需要大团队才能做的事。
至于“完全靠AI写的程序能落地吗”——能。
但前提是,指挥AI的人,必须懂业务。
你想想,一个不懂音乐的指挥,能带好交响乐团吗?
AI是刀,你是刀客。刀越锋利,刀客越要稳。
读者评论 3