
今天想聊的话题有点分裂——一边是 AI 编程工具被资本市场捧上天一边是研究数据给了它一记响亮的耳光。先说第一条线。8 月 14 日SpaceX 正式完成了对 Cursor 母公司 Anysphere 的收购交易金额 600 亿美元。这不是意向书不是备忘录是交割完毕。Cursor 的 400 万日活开发者用户连同它的代码库、模型接口、品牌全归入了马斯克的 SpaceXAI 部门。紧接着8 月 29 日OpenAI 发了一则公告鉴于 Cursor 被 SpaceX 收购将于 11 月 12 日终止对 Cursor 的直接模型访问权限。理由写得很直白——鉴于马斯克旗下公司违反合同的前科我们无法确信 SpaceX 会在服务条款范围内合理使用我们的技术。两条消息叠加AI 编程工具赛道一下子被推到了风口浪尖。但就在这个节骨眼上另一条不那么起眼的研究结果也浮出了水面它问了一个更根本的问题这些工具真的让开发者更快了吗METR 的数字比任何口水都有说服力METRModel Evaluation Threat Research是一个非营利 AI 研究机构声明从不接受 AI 公司资金立场相对独立。今年上半年他们做了一项随机对照实验招募了 16 名经验丰富的开源开发者让他们处理 246 个真实的代码仓库任务修 bug、加功能、改逻辑随机分配是否允许使用 Cursor 这类 AI 编程工具。结果出乎所有人的意料——使用 AI 工具的开发者完成任务的时间反而多了 19%。这个数字让研究主导者 Joel Becker 和 Nate Rush 自己都懵了。他们做实验之前主观预期是 AI 能带来 24% 的效率提升结果出来的数据是反向的。更离谱的是实验结束后开发者们仍然觉得自己比不用 AI 时快了 20%。也就是说主观感受和客观数据之间差了将近 40 个百分点。为什么会这样METR 的分析指向了几个关键原因第一AI 生成的代码需要花大量时间验证。有经验的开发者不会盲目接受 AI 的输出。他们需要读一遍 AI 写的代码判断逻辑是否正确再决定要不要合进来。这个审阅过程本身消耗了大量时间而且很多时候AI 写的代码乍一看没问题但经不起仔细推敲——改来改去时间就花掉了。第二AI 倾向于走捷径而不是做对的事。研究者在跟踪中发现开发者拿到 AI 生成的结果后如果发现有问题往往倾向于微调而不是重写。原因是 AI 生成的代码看起来太完整了修改者本能地不想推翻它结果修修补补出一堆技术债。第三AI 没有在真正难的地方帮到忙。编程的核心瓶颈从来不是写代码这个动作本身而是想清楚要写什么。需求理解、架构设计、边界条件排查——这些才是真正消耗时间的环节。而当前 AI 编程工具擅长的是填充而不是判断。这跟 SpaceX 收购 Cursor 放在一起看很有意思一边是 600 亿美元的真实交易说明资本市场对 AI 编程的预期极高。另一边是 19% 的实测效率下降说明实际效果和营销说辞之间还有巨大鸿沟。这两种矛盾的信息同时存在本身就是行业现状的写照。我个人的看法是METR 的数据没有错但它的结论有边界。边界在哪里在有经验的开发者和真实的开源仓库任务这两个限定条件上。METR 找的是本身就熟悉代码库的资深开发者他们面对 AI 生成的结果时审阅成本天然就高。对于一个熟悉自己项目的工程师来说看 AI 写的代码往往比自己写还累——因为要帮他擦屁股。但换一个场景如果你是一个刚接触新框架的开发者或者在做一次性的原型验证AI 工具的效率提升是实打实的。我见过不少前端新手用 Cursor 十分钟搭出一个能跑的 React 页面这放在以前光配环境就要半小时。所以问题不是AI 编程工具有没有用而是它对谁有用在什么场景下有用。OpenAI 断供之后Cursor 的模型格局会怎么变回到交易这件事本身。OpenAI 断供对 Cursor 影响多大目前 Cursor 的用户可以选 GPT-4o、Claude Sonnet、Grok 等多个模型。OpenAI 的模型大概占 Cursor 流量的 5% 左右——比例不算高但 GPT 系列在代码生成任务上的表现一直被认为是最强之一。Cursor 的应对策略其实已经摆上台面了。收购前他们就与 xAI 联合训练了 Grok 4.5用到了数万亿 token 的 Cursor 代码数据。接下来Cursor 大概率会全面转向 Grok 和 Claude 的组合。Anthropic 可能是这场博弈中最大的赢家——Claude Sonnet 在代码能力上一直跟 GPT-4o 打得有来有回这次 OpenAI 主动让出一个入口Claude 在 Cursor 内的份额大概率会涨。更长远地看Cursor 被 SpaceX 收购后能拿到全球最大的 GPU 集群之一Colossus II 数据中心这意味着他们可以自研更强的代码模型不再依赖第三方。这笔账算下来600 亿的收购价可能并不贵——如果 Cursor 最终能成为 Grok 模型的开发者入口这个入口的价值远不止 600 亿。所以AI 编程到底有没有提高效率这是今天最核心的问题我没有标准答案只有几个观察。观察一当前 AI 编程工具最大的价值不在写得快而在降低门槛。让一个不会写代码的人能写出能跑的代码这是一件了不起的事。但让一个资深工程师写得更快目前的数据不支持这个结论。观察二效率的定义需要重新思考。如果只看写代码的速度AI 确实快。但如果看正确解决问题的速度AI 带来的审阅成本和纠错成本可能抵消了它的速度优势。GitClear 对 2.11 亿行代码变更的分析发现2024 年 AI 工具带来的代码重复率上升了 8 倍——写得快不等于写得好。观察三这个行业正在经历典型的技术采纳曲线早期混乱。营销走在前面工具走在中间最佳实践落在最后。我们会经历一段工具很强大但用不好的时期然后慢慢沉淀出真正高效的工作流。METR 的研究就摆在那19% 的数字是客观的。但作为一线开发者你有没有觉得 AI 编程工具确实帮你省了时间或者你也有审阅 AI 代码比自己写还累的体验欢迎在评论区聊聊你的真实感受。