METR 研究:2025 年初的 AI 工具让资深开发者慢了 19%
早期试验发现,开发者以为自己更快,实际却更慢。后续研究认为新工具可能更有帮助,但选择偏差让提速幅度难以可靠估计。
觉得用了 AI 更快,和真正更快完成工作,可能是两回事。2025 年 7 月,研究机构 METR 公布了一项随机对照试验:16 名资深开源开发者在熟悉的项目中完成 246 项真实任务,允许使用当时的 AI 工具后,平均耗时反而增加了 19%。
有意思的是,开发者完成任务后仍以为 AI 帮自己提速约 20%。研究原文记录了这个感受与结果之间的落差。它测的是一批人在特定项目、特定时期的工作,不是给所有 AI 编程工具盖章。
“慢了 19%”需要带着时间和场景读
这些人已经熟悉自己的代码库;研究使用的主要是 2025 年初的 Cursor 和 Claude 工具。结论不能直接套到刚学编程的人,也不能直接套到 2026 年的新模型。让 AI 从零做一个小页面,和维护一个有多年惯例的项目,本来就不是同一种任务。
这项结果提醒我们,等待回答并非全部成本。一个需要采用的修改,还要被读懂、核对、测试和调整。编辑建议在比较工作方式时,把这些时间都算到完成过程里,而不是只记录 AI 生成用了多久。
对没有写代码的人,这个问题也成立。让 AI 起草一封邮件,再花十五分钟删掉虚构细节,未必比自己写几句更省时。相反,面对陌生材料,它若帮你快速找到下一步,可能省下很多查找时间。需要比较的是你自己的完整任务。
后来发生了什么
METR 在2026 年 2 月的后续说明中认为,新的 AI 工具很可能比早期工具更能帮助开发者提速,但后续试验受到明显的参与者和任务选择偏差影响。有些开发者不愿在禁用 AI 的条件下工作,也会避开提交他们认为 AI 特别有用的任务。因此,新数据无法可靠确定提速幅度。
这不是一个整齐的“先证明没用,后来证明有用”的故事。早期研究给出了有条件的实测结果;后续工作发现,随着用法和参与者行为变化,原来的测量方法也需要调整。
如果你想判断自己是否受益,可以连续记录几项相似工作:从拿到材料,到完成能交付的版本,花了多久,返工几次,最后质量怎样。也记录 AI 帮你做成了哪些原本做不了的事。前者是效率,后者是能力扩展,两者都值得看,但不要混成一个笼统的“感觉更快”。