采用与生产率
能力代表潜力,生产率衡量的则是通过验收的工作发生了多少变化。模型可能让起草者更快,却让审核者更慢;可能提高一个人的产出,却堵塞共享队列;也可能在基准上进步,却没有改变组织最终交付的任何东西。因此,评估采用效果必须有一个反事实基线:如果沿用被替代的规则,同一批符合条件的工作会产出什么,又会付出多少成本?
第 77 章 讨论购买方是否拥有可信的替代方案。本章要问的是,采用其中一个方案后,工作是否发生了值得关注的变化。一项站得住脚的结论,必须说明通过验收的工作单位、任务范围、工作者群体、工作流、工具版本、审核规则和时间窗口。只要其中一项改变,原来的生产率估计就可能不再适用。
先固定工作单位,再衡量工具
计量应从一个完成的工作流单位开始,而不是从职位名称或一次模型调用开始。客服工作的单位,可以是一张在固定退回期限后仍被认定为已解决的工单。软件工作的单位,可以是一项已经合并、通过审核与测试,并且度过延迟缺陷观察期的变更。政策工作的单位,可以是一份经过裁定、其中各项主张都满足固定评分规则的备忘录。放弃、升级处理或被拒绝的尝试仍留在分母中。
任务层面的边界很重要。职业暴露研究估算的是,在质量不变时,语言模型可能在哪些任务上缩短时间;它不衡量采用、实际生产率、岗位替代或投资回报 (Eloundou et al. 2024)。一个职位包含许多任务,还包含协调、问责,以及仍须在工具之外完成的工作。应当先测量工作流单位,再做汇总。
试点开始前,先记录评估契约:
| 字段 | 必须固定的内容 | 为什么会改变估计 |
|---|---|---|
| 符合条件的单位 | 触发条件、必需输入、完成状态、排除项 | 防止简单工作或被放弃的工作悄悄离开分母 |
| 群体 | 任务类别、工作者或团队、经验层级、地点 | 限定估计适用于哪些人和哪些工作 |
| 处理方案 | 模型、界面、检索、提示词库、工具、培训 | 让「获得 AI 使用权」成为可以复现的干预 |
| 审核规则 | 审核者角色、评分规则、升级路径、缺陷观察期 | 把生成之后的劳动与质量边界纳入计算 |
| 基线 | 当前工作流、人员配置、软件和服务水平 | 明确真正要比较的反事实方案 |
| 观察期 | 上手期、稳定期和稳态期 | 区分学习过程与新鲜感造成的短期效应 |
生产率不是一个代理指标 (Organisation for Economic Co-operation and Development 2001)。决策时应同时保留一组指标,包括通过验收的产出率、主动劳动时间、端到端周期时间、首次通过率、审核时间、返工、升级处理、按严重程度加权的缺陷、事故、客户结果和工作者体验。对于分配组 ,可以先计算三个摘要指标:
式中, 表示基线组, 表示辅助组。 是通过验收的产出率; 是通过验收的单位数; 是有报酬的总劳动时数,包括生成、检查、修正、升级处理和协调。 是首次通过率,其中 表示无需修正便通过验收的单位数, 包含所有被分配的合格单位。 是按严重程度加权的缺陷率; 表示预先声明的 个严重度等级之一, 是该等级的固定权重, 是 组中属于等级 的缺陷数。报告 时还要同时报告原始缺陷数量,避免权重选择掩盖伤害。
提示词数量、生成的词元数、登录次数和满意度可以帮助解释机制,却都不是生产率。如果验收质量、返工或延迟缺陷变差,完成得更快同样不是生产率提升。
衡量获得工具使用权的效果
条件允许时,应在预先确定的分层内随机分配工具使用权,例如按任务类别、基线产出和工作经验分层。这里, 表示随机化单位, 表示被分配工具使用权, 表示被分配到基线方案, 是该单位预先锁定的主要结果。辅助组和基线组的分配数量分别为 和 时,样本意向处理效应为
意向处理效应衡量的是,在这些条件下提供这项工具所产生的政策效果。即使有人获得了使用权却没有使用,也仍然保留在计算中。实际使用是分配之后的选择。直接比较自愿使用者与未使用者,会把工具效果与动机、任务选择和预期收益混在一起;把这种差异称为因果效应,就会产生选择偏差。不依从情况可以通过实际采用率另行报告;在满足所需工具变量假设时,也可以估计依从者效应,但它并不是所有工具使用者的平均效应 (Angrist et al. 1996)。
随机化单位必须与干扰边界一致。如果同事共享队列、模板、审核者或会议负担,按个人分配工具可能让影响溢出到对照组。只要这些互动不可忽略,就应按团队或工作流做整群随机化,并在相同层级上分析。如果直接效应和溢出效应本身都是决策关心的问题,则需要网络设计或饱和度设计 (Hudgens and Halloran 2008)。
预先声明少量真正有用的分层,例如任务类别、经验、错误严重度和工作流成熟度。报告效应量、不确定性区间和子组样本量。「这里显著、那里不显著」不能证明两个子组效应不同。在上手和学习阶段也要保留原始随机分配,并为模型、界面、提示词库、人员配置和任务组合的每次变化记录版本。
把价值和成本记在同一本账上
在组织没有可靠的换算规则之前,各项运营指标应分别报告。需要作出财务决策时,应在同一个核算期 内比较两组:
是核算期 内的增量净收益。 是 组已经实现的收入或贡献价值; 是观察到的可变运营成本,包括劳动、模型、审核、返工、升级处理和协调; 是新增的集成、安全、法律、采购和培训成本。 是错误与事故造成的损失,因此 表示预期损失的变化。每一项都必须采用同一种货币和同一个核算期。第 0 组是基线组,第 1 组是辅助组。
有两个常见的核算错误需要避免。第一,节省一小时只是释放容量,并不自动等于现金。只有当组织能把这段时间重新投入其他工作、减少招聘、增加通过验收的产出,或减少有报酬工时,才可以把它换算成财务收益。换算规则必须写明。第二,不要把同一次质量改善既算作收入,又算作避免返工。如果质量改善或罕见的灾难性损失无法可靠定价,仍应作为单独的护栏和压力情景保留。
如果决策关注稳态单位成本, 是每个通过验收单位的固定成本摊销额,其中 是核算期 内计划通过验收的产量。把试点中观察到的成本与预测产量分开。报告 的不确定性区间,并分析它对劳动价值、产量、事故概率和缺陷观察期的敏感程度,不要只给出一个看似精确的回报数字。
下面的交互图使用的是示意性的归一化价值单位,不是百分比、价格、证据或预测。它的作用,是让人看见哪些假设会让决策反转。真正的试点必须用同一个核算期内两组的数据填写这本账。
为什么有用的工具起初可能显得低效
能力与实测产出之间的落差并不是新现象。生产率 J 曲线描述的是,一项通用技术可能先要求组织完成互补投资,之后收益才会进入可测产出。组织最初要积累的是无形资本,包括新流程、数据、培训、管理惯例和软件。在这段时间里,投资成本已经发生,未来产生的服务却很难被当前统计捕捉 (Brynjolfsson et al. 2021)。
生成式 AI 不会消除这套机制。业务流程重设计可能改变由谁起草、由谁审核、哪个队列负责异常,以及通过验收的工作怎样送达客户。独立的聊天窗口可以提高个人起草速度,却不一定改变共享审批路径。这样的测量滞后不能据此假定收益以后必然出现。它要求组织分别测量互补投资、采用时间和稳态工作流,而不是从一次演示外推长期收益。
阅读实证结果时,不要丢掉适用边界
早期研究回答的是不同问题,不能合并成一个适用于所有场景的效应量。
Noy 与 Zhang 随机分配 453 名受过大学教育的专业人士,让他们在有无 ChatGPT 的条件下完成有报酬的中等难度写作任务。在这些短任务上,获得工具使用权使完成时间缩短 40%,输出质量提高 18% (Noy and Zhang 2023)。这项实验确立了边界明确的任务效应,不能证明团队产出、就业或企业利润发生变化。
Dell'Acqua 等人在一家公司的 758 名顾问中开展预注册实验。研究使用了两套任务:第一套包含 18 项产品、分析和写作任务,研究者事先判断它们位于 GPT-4 在 2023 年 6 月的能力边界之内;第二套是一项商业案例,其中故意放入了一项边界之外的任务。在边界内的一组任务中,使用 AI 的参与者多完成 12.2% 的任务,速度快 25.1%,评分质量也更高。在那项特意选择的边界外任务上,合并计算的 AI 组正确率低 19 个百分点 (Dell'Acqua et al. 2026)。这组对比说明能力边界可能呈锯齿状,却不能为其他模型、工作者或工作流定义永久边界。因此,旧版合成曲线已经删除。
Brynjolfsson、Li 与 Raymond 观察了一项实时助手在 5,172 名客服坐席之间分阶段推广的过程,涉及一家企业、其外包人员和三百万次对话。其主要双重差分估计显示,每小时解决的问题数提高 15%,经验较少、技能较低的坐席收益更大。技能最高的一组几乎没有产出率提升,部分质量指标还略有下降 (Brynjolfsson et al. 2025)。这是对该助手和该场景有力的现场证据,不是跨职业的大规模随机估计。
Dillon 等人在 66 家自愿参加的企业中,将集成工具的使用权随机分配给 7,137 名工作者。在第四至第六个月,获得使用权使每周邮件会话时间减少 1.4 小时;工具变量方法对依从者给出的估计为每周减少 2.0 小时。研究没有发现会议时间、Word 使用时间、完成文档数量或若干协调指标的平均变化达到显著水平 (Dillon et al. 2026)。遥测记录到的是时间分配变化,不是产出质量或组织回报。这也说明,个人起草变快不一定会改变一套需要多人协调的惯例。
Becker 等人随机决定 16 名开发者能否在 246 项任务中使用 2025 年初的工具。这些任务来自他们熟悉的成熟开源项目。允许使用 AI 后,完成时间增加 19%,95% 区间为慢 2% 至 39%,尽管参与者认为工具帮了忙 (Becker et al. 2025)。这个结果适用于短小的存量项目问题、熟悉代码库的专家和 2025 年 2 月至 6 月的工具。它没有估计当前工具、从零开发、长期代码质量或团队产出。METR 后来调整后续研究设计,是因为人们越来越依赖 AI,难以招募有代表性的无 AI 对照组。这是选择问题,并不是对第一次估计的干净反转 (METR 2026)。
更宏观的结果可能远小于局部任务变化。一项 2026 年修订的研究,把丹麦调查数据与行政记录连接起来。研究发现聊天机器人使用迅速增长,任务也发生重组,包括新增监督和集成工作;但没有检测到收入或记录工时的平均影响。其估计排除了在 ChatGPT 发布两年后,工作者和工作场所层面超过 2% 的效应 (Humlum and Vestergaard 2025)。这并没有否认局部节省时间。它说明任务时间、工作变化、工时、收入和总体生产率是不同的结果。
分清采用、使用、能力与实际价值
使用日志只能定位请求,不能说明输出是否正确、是否通过验收、是否有用。Anthropic 最初的 Economic Index 总共分析了超过四百万次 Claude 对话;其中主要的职业分析使用的是自我选择的 Free 和 Pro 对话,并排除了企业和 API 流量。软件开发和写作请求在这个产品样本中占比最高,但研究没有观察用户职位、最终产出或生产率 (Handa et al. 2025)。
GDPval 问的是另一个问题。它向模型提供一次性任务、必要上下文和一项独立交付物,任务来自 44 个知识工作职业。专家评分者发现,2025 年表现最强的模型在公开的 220 项标准任务集上,交付物质量正在接近专家 (Patwardhan et al. 2025)。这个基准没有包含与客户反复沟通、组织语境、系统集成和大部分人工监督。使用日志和 GDPval 都不能证明因果生产率或组织回报。
采用调查提供了第三层证据。美国人口普查局一项全国代表性的补充调查覆盖 2025 年 11 月至 2026 年 1 月,结果显示,18% 的美国企业报告在至少一项业务职能中使用 AI。在已经采用的企业中,57% 只在不超过三个职能中使用 (Bonney et al. 2026)。这些自报数据衡量的是采用与覆盖范围,而不是因果产出增益;论文中采用与企业表现之间的关系是相关关系,而不是因果关系。
| 证据 | 可以证明什么 | 仍未测量什么 |
|---|---|---|
| 能力基准 | 固定任务和评分者下的表现 | 采用、工作流成本、溢出效应和利润 |
| 产品使用日志 | 在该产品和样本中观察到的请求 | 通过验收的产出、反事实基线和因果效应 |
| 采用调查 | 自报使用情况和组织覆盖范围 | 实际使用质量、净收益和作用机制 |
| 受控任务实验 | 对特定任务、人员和处理方案的因果效应 | 未测试的工作流与均衡效应 |
| 现场实验或分阶段推广 | 真实部署政策下的运营效应 | 超出该企业、时期和政策后的推广能力 |
| 行政结果研究 | 下游工时、收入或就业 | 缺少关联日志时的局部质量与流程机制 |
不存在一个稳定不变的「AI 辅助工作」类别。工具能力会变化,工作者会学习,任务组合会改变,组织也会围绕有效用法重设计流程。正向平均效应可能掩盖高严重度任务中的伤害;企业层面的零效应可以与有价值的局部容量同时存在;早期变慢既可能是投资,也可能是真正的失败。每项结论都必须与它的群体、处理方案版本、结果、审核边界和日期绑定。异质性本身是需要估计的结果,不能在看到结果之后拿来解释任何方向的变化。
把采用试点当作决策流程
试点结束时应当留下支持一项有边界政策的证据,而不是满意度分数:
- 固定工作单位。 声明符合条件的工作、验收规则、缺陷观察期、任务分层、工作者群体和当前基线。
- 登记实验设计。 锁定随机化单位、主要结果、最低值得采用的效应、样本量和时长、子组方案、缺失数据规则、中期分析规则、伤害边界和回滚触发条件。
- 同时记录两组。 对每个合格单位记录分配结果、实际使用、主动劳动、审核、返工、升级处理、协调、模型成本、失败和带版本的工作流事件。
- 执行验收规则。 条件允许时,采用盲于实验条件的审核;把失败保留在分母中,并等待延迟缺陷观察期结束。
- 估计效应。 报告各组总量、实际采用率、意向处理效应、不确定性区间、预先声明的异质性、溢出效应,以及按事件时间计算的学习过程。第 48 章 提供区间估计与停止规则。
- 核算价值与成本。 只换算有可靠依据的收益和成本,写明把容量转为现金的假设,把无法定价的质量与安全要求保留为护栏,并对罕见损失做压力测试。
- 作出有边界的决策。 只有当不确定性区间下界越过采用门槛,而且所有护栏都通过时才正式采用;如果采用率或工作流摩擦使结论仍不明确,就继续迭代;一旦触及预先声明的伤害边界,就停止并回滚。
证据记录应保留方案及其修订记录、分配表、任务与工作者分层、处理方案版本、原始分组总量、缺失情况、验收决定、缺陷观察、成本规则、估计值与区间、护栏结果和最终决策。NIST 的生成式 AI 风险管理框架同样把部署前测试与有记录的上线或不上线决策、事故响应和部署后监测连接起来 (National Institute of Standards and Technology 2024)。
第 77 章 决定试点是否拥有可信替代方案;第 76 章 提供模型与基础设施成本;第 48 章 提供推断契约。下一章 第 79 章 还会加入权利与合规条件,它们可能让一套原本有生产率收益的工作流无法使用。经济单位始终是一个通过验收且可问责的工作结果,不是一个词元或一次模型调用。
能力代表潜力,生产率衡量的则是通过验收的工作发生了多少变化。
延伸阅读
- Organisation for Economic Co-operation and Development, “Measuring Productivity: OECD Manual” (生产率水平与增长的定义和测量指南), 2001. doi.org该手册解释了为何生产率必须把明确的产出指标与明确的投入联系起来,并说明有效比较所需记录的选择。
- Eloundou et al., “GPTs are GPTs: Labor Market Impact Potential of LLMs” (任务暴露度估计,而非实际采用或生产率), 2024. doi.org该论文估计在任务质量不变时语言模型可能影响多少职业任务时间;它并未测量实际工作场所效果。
- Angrist et al., “Identification of Causal Effects Using Instrumental Variables” (工具变量估计的潜在结果解释), 1996. nber.org该论文说明了在实际接受处理不完全时,随机分配能够识别服从者平均因果效应所需的假设。
- Hudgens & Halloran, “Toward Causal Inference with Interference” (一个单位的处理会影响另一单位时的因果设计), 2008. pmc.ncbi.nlm.nih.gov该论文定义了处理在组内产生溢出时的直接、间接、总计和整体因果效应。
- Brynjolfsson et al., “The Productivity J-Curve: How Intangibles Complement General Purpose Technologies” (为何互补性无形投资可能先于可测量的生产率收益), 2021. doi.org作者通过模型和证据说明,对流程及其他无形资本的高成本投资最初可能掩盖通用技术带来的产出收益。
- Noy & Zhang, “Experimental Evidence on the Productivity Effects of Generative Artificial Intelligence” (有明确边界的专业写作任务随机证据), 2023. doi.org在一项涉及 453 名专业人士的实验中,ChatGPT 使用权限缩短了短期激励写作任务的完成时间,并提高了评分质量。
- Dell'Acqua et al., “Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of AI on Knowledge Worker Productivity and Quality” (758 名咨询顾问在选定能力边界内外任务上的实验), 2026. doi.org咨询顾问在 GPT-4 能力边界内的选定任务上提高了速度和质量,却在刻意选取的边界外任务上降低了正确率。
- Brynjolfsson et al., “Generative AI at Work” (面向 5172 名客服坐席的真实分阶段上线), 2025. doi.org在一家客服业务中,对话式助手提高了每小时解决的问题数,经验较少和技能较低的坐席收益更大。
- Dillon et al., “Shifting Work Patterns with Generative AI” (即将发表;7137 名符合条件员工的六个月随机现场实验), 2026. aeaweb.org集成式 AI 使用权限减少了邮件会话时间,但没有检测到会议、Word 使用、完成文档或若干协调指标的平均变化。
- Becker et al., “Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity” (成熟开源代码库中熟悉问题的随机试验), 2025. arXiv:2507.0908916 名经验丰富的开发者使用 2025 年初的 AI 工具处理 246 个问题时多花了 19% 的时间,尽管他们预期并感知到提速。
- METR, “We Are Changing Our Developer Productivity Experiment Design” (开发者后续研究中选择问题的更新), 2026. metr.orgMETR 解释了为何开发者日益依赖 AI 使计划中的无 AI 对照组失去代表性,并迫使其改变实验设计。
- Humlum & Vestergaard, “Still Waters, Rapid Currents: Early Labor Market Transformation under Generative AI” (2026 年修订;丹麦调查与劳动力市场行政记录的关联研究), 2025. nber.org丹麦关联数据发现聊天机器人使用和任务重组迅速增长,但在 ChatGPT 发布两年后,记录工时或收入未出现可检测的平均影响。
- Handa et al., “Which Economic Tasks Are Performed with AI? Evidence from Millions of Claude Conversations” (映射到职业任务的产品使用证据), 2025. arXiv:2503.04761该研究把数百万条抽样 Claude 对话映射到职业任务,描述产品使用情况,但不观察用户职业、被接受的产出或生产率。
- Patwardhan et al., “GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks” (跨 44 个职业、由专家评分的独立交付物), 2025. arXiv:2510.04374GDPval 测试来自 44 个职业任务的一次性模型交付物,衡量的是有边界的能力,而非工作场所采用或净价值。
- Bonney et al., “The Microstructure of AI Diffusion: Evidence from Firms, Business Functions, and Worker Tasks” (企业自报采用情况与广度的全国代表性证据), 2026. census.gov该调查估计企业在各业务职能中的 AI 采用情况,并显示多数采用企业的使用范围仍较窄;它不识别因果生产率。
- National Institute of Standards and Technology, “Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile” (生成式 AI 特有风险与行动), 2024. nvlpubs.nist.govNIST 生成式 AI profile 将 AI RMF 调整到生成式系统的特有风险,本章把这些风险翻译成运营控制。
评论
登录后评论