“等你跟AI描述完需求、看完它生成的代码、再改完它的bug,我手敲都写完了。”
这句程序员之间的经典吐槽,最近变成了知乎热榜上的正式提问:如何向别人解释“有你这AI写代码的时间,我早就古法编程写完了”?
“古法编程”这个词是vibe coding(氛围编程)火了之后才有的,借的是“古法酿造”的说法——手工输入、从零实现、不用任何AI辅助。这个问题妙就妙在:它问的不是“AI写得好不好”,而是“快不快”。而“快不快”恰好是能拿实验数据回答的。我把近一年的几份研究翻了一遍,发现答案比两边吵架的人想的都有意思。
吐槽的人,可能真没说错
2025年7月,AI研究机构METR公布了一项随机对照实验:16位资深开源开发者——平均在自己维护的代码仓库上干了5年,这些仓库平均超过2.2万star、上百万行代码——完成246个真实任务,一半允许用AI,一半禁止,全程记录实际耗时。
结果:用AI的那组,平均慢了19%。
更扎心的是第二组数字。这批开发者事前预测AI能帮自己快24%;实验做完、甚至看到自己的用时数据之后,仍然坚信自己快了20%。感受与现实之间,差了39个百分点。
所以知乎那个问题,数据给出的第一层答案是:在某些场景下,“古法编程更快”不是守旧者的嘴硬,是被对照实验验证过的事实。
但要看清实验是在哪儿做的
慢19%的结论有严格的边界条件:这批人是顶级熟手,干的是自己维护了5年、闭着眼都知道哪儿放什么的上百万行代码库。对他们来说,“上下文”早就在脑子里,AI反而成了累赘——描述需求要花时间,生成的代码要逐行核对,改它的不如自己写。
反过来的证据也有。Anthropic今年1月发布过另一项随机对照试验:52名初级工程师学习一个谁都没接触过的异步编程库Trio,AI组完成任务平均快约2分钟(未达到统计显著),但随后的理解测验里,AI组平均50分,手写组67分。真正拉开差距的不是用没用AI,而是怎么用:把代码生成整个甩给AI的人,得分低于40%;让AI写代码但追问“为什么这么写”、只用AI解释概念的人,得分在65%以上。
两份实验拼在一起,图景就完整了:AI编程的快慢,不取决于AI,取决于你和任务的关系。 领域越陌生、你越需要有人带着走,AI越赚;你越是深耕多年的熟手,AI的“描述—核对”成本越可能吃掉它省下的打字时间。微软杰出工程师David Fowler 9月4日那句刷屏的“敲代码的时代彻底结束了”,和“古法编程更快”的吐槽,其实说的是同一片森林的不同角落——纳德拉也公开说过,微软内部已有20%到30%的代码由AI编写。没人真的退回手工,争的只是哪段活该给谁。
吵架双方都在拿感觉当证据
回到那个39个百分点的感知偏差。METR去年8月想做后续实验,结果做不下去了——越来越多开发者拒绝在没有AI的条件下完成任务,30%到50%的参与者承认会刻意挑那些“离了AI不想干”的活儿提交,今年2月METR只好改了实验设计。
这说明什么?说明“AI快还是手工快”这场争论,双方引用的往往都是自己的体感,而体感在这件事上系统性不可靠。Claude Code的作者鲍里斯·切尔尼9月10日公开回复一位开发者来信时给过一个务实的分法:原型和一次性代码,尽管当黑箱用,反正要扔;进生产环境的代码,标准应该比人写的更高,得经得起审查。他没站队“AI派”或“古法派”,他站的是“这段代码要活多久”这一队。
给普通人的抄作业版
你未必写代码,但“古法还是AI”这道题人人都在做——写方案、做表格、改简历都一样。三条可以直接拿走:
一、按熟悉度分工。 深耕多年的老本行,你的“脑内上下文”就是最大资产,AI帮的是打字,核对成本可能倒挂;陌生领域、新工具、没干过的活,放心交给AI带路。
二、别让AI替你思考,让它替你解释。 Anthropic实验里得分高的人只做对了一件事:AI生成之后追问一句“为什么这么做”。这一个动作,就是65分和40分的分界线。
三、按“这东西要活多久”定标准。 一次性的草稿尽管快跑,要长期用的东西必须自己看得懂。我自己日常在 spark1.cn 的 /ai-writer 里起稿、在 /tools/ 里挑顺手的小工具,用的也是这个分法:起稿求快,定稿求懂。
下次再有人跟你抬杠“古法编程更快”,你可以笑了:都对,看活儿。真正的问题从来不是谁打字快,而是谁在敲下回车之前,真的看懂了自己交出去的东西。
本文素材综合自腾讯新闻、凤凰网科技、InfoQ、少数派、掘金等公开报道与研究资料。
💬 评论