采用与生产率
AI 只有改变了工作,才真正进入经济现实。基准分数是采用的输入,不是采用的结果。结果是扣除时间节省、质量改善、审查增加、错误修正、集成建设和人员训练之后留下的净值。本章连接模型经济学与组织经济学:它要问,能力何时变成生产率。
能力不是 ROI
最小的采用等式是:
第一项是演示里最容易看到的东西。其余部分才是部署真正要付的账。模型成本可见,因为它以 API 账单出现。审查成本不那么可见,因为它以资深人员时间出现。集成成本藏在身份、日志、权限、数据访问、评测与回滚系统里。错误成本则是尾部风险:流畅的答案恰好在出错代价很高的地方出了错。
下面这组滑块,就是这条等式可以动手调的版本。一个工具可以节省时间,却也会因审查和返工的尾部过大而毁掉价值;反过来,一个普通模型只要待在狭窄且复核到位的工作流里,照样能盈利。
锯齿边界
最好的实证框架是「锯齿技术边界」。Dell'Acqua 等人研究了 758 名顾问,发现 GPT-4 访问权在能力边界内改善了表现:工作者完成任务多 12.2%,平均快 25.1%,质量也提高。在边界外的一项任务上,AI 用户给出正确解的概率反而低 19% (Dell'Acqua et al. 2023)。教训不是 AI 好或坏,而是相邻任务可能看起来相似,却落在能力边界的两侧。
这点之所以重要,在于组织很少把 AI 部署到孤立的基准任务上。它们部署到混合难度的工作流里:客服回答常见问题,随后遇到账户边界条件;开发者写一个辅助函数,随后必须保住项目约定;分析师起草备忘录,随后要判断一条一次性的合同条款。AI 的价值,在模型能力和复核者能力重叠的地方最高;而一旦模型看起来可信、复核者却难以低成本判断它对不对,价值就会下滑。
实证结果
最强的采用结果出现在边界清楚、反馈快速的工作流中。一项覆盖 5172 名客服坐席的研究发现,对话式助手平均把每小时解决问题数量提高 15%,收益最大的是经验较少的员工 (Brynjolfsson et al. 2023)。这个场景有几个有利条件:任务重复但有变化,答案可以通过客户反应检验,系统也嵌入了工作表面,而不是要求员工发明一个新流程。
更宽泛的知识工作实验则更混合。一项覆盖 6000 名员工、持续六个月的随机现场实验发现,AI 访问权主要改变了个人可以独立改变的工作:使用者每周少花三小时处理邮件,但会议时间没有显著变化 (Dillon et al. 2025)。这很重要,因为会议是协调产物。工具可以帮一个人更快起草,却未必改变制造会议的组织惯例。
软件开发把边界呈现得很尖锐。一项针对成熟项目中经验丰富开源开发者的随机实验发现,2025 年初的 AI 工具让完成时间变慢 19%,尽管开发者事前预计会加速,事后也以为自己加速了 (Becker et al. 2025)。这并不说明编程辅助普遍不赚钱。它说明生产率取决于项目熟悉度、复核负担、代码库约束和任务形状。一个新脚本和一个成熟项目,是两种不同的经济对象。
2025 至 2026 年的大规模用量数据指向同一方向:Anthropic 的 Economic Index 基于数百万条匿名化对话,发现使用集中在一小批边界清楚的职业任务上 (Anthropic 2025);OpenAI 的 GDPval 用 44 个职业的真实工作交付物给模型输出评分,发现模型最接近专家水平的,正是有边界、可复核的工作产物 (Patwardhan et al. 2025)。异质性仍在,但数据已经显示出价值集中在哪里。
生产率争论不能由一项正面或负面研究终结。效果高度异质。辅助在有边界、高频、可复核的任务上有效;在成熟系统中的专家工作上,则可能把生成省下来的时间,重新交给理解、修正与集成。更有用的问题不是「AI 是否提高生产率」,而是「哪些任务、哪些工作者、哪种复核回路、什么错误成本」。
采用架构
把采用当作系统设计问题:
- 任务盘点。 按任务类别拆工作,而不是按职位名称拆。给每类任务标出频率、错误成本、可复核性和数据敏感性。
- 工作流位置。 把 AI 放在工作者本来行动的地方。单独的聊天窗口会增加上下文搬运,并遮住来源。
- 复核设计。 在输出离开边界前,先决定什么必须被检查。复核步骤不是事后税,而是产品的一部分。
- 测量。 测周期时间、质量、返工、升级和工作者信任。不要只测生成词元数或提示次数。
- 变更管理。 为培训、策略、采购和重写惯例留预算。模型可以瞬时可用,组织采用不会。
采用会反过来影响 第 76 章。若一个工作流产生真实节省,用量上升,自建与购买的阈值就会移动。若审查成本占主导,这个工作负载应该用更小的模型、更窄的工具,甚至不用 AI。经济单位不是「一个词元」,而是一个完成、被接受且可问责的工作单元。
采用测试
在购买平台或自建内部模型前,按任务层级做受控试点。能随机分配访问权时就随机。保留基线。计算复核时间。计算返工。把新手和专家分开。跟踪流程本身是否改变,还是人们只是更快地起草同一份工作。试点结束时应当得到一张任务地图,而不是一份泛泛的情绪分数。
能力正在变便宜。改变仍然昂贵。能捕获价值的组织,不会是最早把模型放到每个地方的组织,而会是那些找到模型能改变工作、同时不把风险移到无人可见之处的组织。
延伸阅读
- Brynjolfsson et al., “Generative AI at Work” (5172 名客服坐席的现场证据), 2023. arXiv:2304.11771一次对话式 AI 助手的分阶段上线平均提升客服生产率 15
- Dell'Acqua et al., “Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality” (758 名知识工作者的锯齿技术边界现场实验), 2023. hbs.eduHBS 现场实验发现,AI 在能力边界内的任务上带来显著收益,但在边界外任务上降低正确率,从而提出锯齿技术边界框架。
- Dillon et al., “Shifting Work Patterns with Generative AI” (6000 名员工的六个月随机现场实验), 2025. arXiv:2504.11436一项覆盖 6000 名员工、持续六个月的随机实验发现,AI 主要改变可由个人控制的工作模式,使使用者减少邮件时间,但没有显著减少会议时间。
- Becker et al., “Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity” (经验丰富开源开发者的随机实验), 2025. arXiv:2507.09089一项针对 16 名经验丰富开源开发者和 246 个任务的随机实验发现,2025 年初的 AI 工具让完成时间变慢 19
- Anthropic, “The Anthropic Economic Index” (把对话映射到职业任务的大规模用量数据), 2025. anthropic.comAnthropic Economic Index 把数百万条匿名化的 Claude 对话映射到职业任务上,显示使用集中在少数任务类别,并在增强与自动化之间分布。
- Patwardhan et al., “GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks” (跨 44 个职业、由专家评分的工作交付物), 2025. arXiv:2510.04374GDPval 用来自美国 GDP 贡献最大的九个行业、44 个职业的 1320 件真实工作交付物评估模型输出,发现前沿模型在规格明确的交付物上接近行业专家水平。
评论
登录后评论