数据权利与合规经济
数据只有在能够被使用时才是经济输入。一份文档可能技术上可访问,容易抓取,也很适合训练,但仍然因为许可证缺失、来源不清、条款禁止 AI 训练,或客户无法接受合规风险而不可用。因此,数据经济学有两类账:一类是词元数量账,另一类是权利账,记录许可、来源、文档和市场准入。
语料是一条供应链
旧的训练数据观念像是一堆东西:更多网页、更多书、更多代码、更多词元。生产视角则要把数据当作供应链。每个数据集都有来源、采集方法、许可证或服务条款、转换历史、过滤策略、署名记录,以及一组可以或不能支持的下游用途。
Data Provenance Initiative 把这个运营层面的问题摆到了台面上。它审计超过 1800 个文本数据集,发现广泛的许可证缺失与错误,并看到商业开放与商业闭合数据类别之间的分化 (Longpre et al. 2023)。因此,「我们在公开数据上训练」不是经济答案。有效答案必须说明:哪些公开数据,依据哪些权利,带着哪些来源记录,适用于哪个法域,又有哪些证据能给客户看。
同意变成了动态变量
一旦模型训练变得有经济意义,权利就不再稳定。Longpre 等人对 14000 个网页域名做纵向审计,发现 2023 到 2024 年间 AI 专用限制迅速增长,robots.txt 与服务条款之间存在不一致,C4(一个被广泛使用的网络爬取训练语料)中大量重要来源因 robots 或 ToS 信号而变为受限 (Longpre et al. 2024)。数据 commons 因而不是固定存量,而是一处争夺性的供给源,其访问规则正因 AI 本身而改变。
这会产生价格信号。容易获取的网页数据一旦变得不那么可用,已许可、第一方、客户批准或合成数据的边际价值就会上升。无法说明自身数据的提供商,会被一些客户打折,甚至被直接排除在采购之外。而能以清晰权利许可高质量数据的领域持有人,便握有一项资产;在默认可抓取的年代,这项资产并不显眼。这个市场已不是预测:已披露的交易中,Reddit 把语料授权给 Google,约每年 6000 万美元;News Corp 把其新闻档案授权给 OpenAI,据报道五年约 2.5 亿美元 (CBS News 2024; Variety 2024)。
法院也开始为这本账的一侧定价。2025 年 6 月,Bartz v. Anthropic 一案裁定:在合法获得的书籍上训练属于转化性的合理使用,而下载并留存影子图书馆的盗版副本则不属于 (Alsup 2025);同一周,Kadrey v. Meta 在合理使用问题上给出了相近的立场 (Chhabria 2025)。Bartz 案随后以 15 亿美元和解,约 50 万本书、每本约 3000 美元,是美国历史上金额最大的版权和解 (The Authors Guild 2025)。把它当作价格信号来读:责任落在获取来源上,而不在训练本身;和解只为过去的行为买单,不构成任何面向未来训练的许可。真正起约束作用的输入,仍然是那本权利账,而不是法庭。
开放权重不能解决数据权利
OSI Open Source AI Definition 有用之处在于,它把产物和修改产物所需的材料分开。它要求使用、研究、修改与分享的自由,并说明机器学习系统的可修改首选形式包括数据信息、代码与参数 (Open Source Initiative 2024)。这个区分在经济上很重要。一个可下载的权重文件可以降低服务锁定,却仍然让买方无法复现训练、审计数据权利,或满足客户的文档要求。
所以,「开放」有时在经济上并不完整。开放权重足以支持本地推断、微调和实验。它未必足以满足一个受监管买方的需求,因为买方可能需要知道训练数据是否包括某些来源,版权材料是否被过滤,退出信号是否被尊重,提供商是否公开了 AI Act 所要求的训练内容摘要。
合规即市场准入
监管把文档变成市场准入。EU AI Act 对通用 AI(GPAI)提供商的义务,包括技术文档、版权政策,以及按欧盟委员会模板公开发布的训练内容摘要,自 2025 年 8 月 2 日起生效,委员会的执法权则从 2026 年 8 月起跟进 (European Commission 2025)。欧盟委员会在 2025 年 7 月 10 日发布的 General-Purpose AI Code of Practice,是证明满足这些义务的自愿路径 (European Commission 2025):其透明与版权章节广泛适用于 GPAI 提供商,安全与安保章节则面向最先进、具有系统性风险的模型。2026 年的 Digital Omnibus 推迟了 AI Act 高风险条款的合规期限,但 GPAI 义务未被推迟,仍然有效 (Council of the European Union 2026)。
从工程视角看,这像是文书工作。从经济视角看,它是市场基础设施。能产出模型文档、版权政策证据、数据摘要、评测记录和事故流程的提供商,才能卖给要求这些材料的买方。不能产出这些材料的提供商,可能仍然有能力,但它能触达的市场并不一样。
尚未解决的问题是如何平衡创新、创作者同意、研究访问、竞争与安全。严格同意规则可以减少未授权使用,并创造许可市场,但也可能让已有数据交易的大公司更占优,并使独立研究更困难。宽松规则保留更大的 commons,却把成本推给创作者和必须承担法律与声誉风险的下游买方。经济问题不只是「谁可以训练」,还包括「谁为不确定性付钱」。Bartz v. Anthropic 为这份不确定性开出了第一个价码,但没有把它消除。
数据权利会反过来影响上面的每一层。它们决定一个模型能否在 第 73 章 的强意义上被称为开放,决定提供商能否在 第 77 章 中通过企业采购,也决定 第 78 章 中的采用试点能否从实验走向生产。权利不是模型造好之后的元数据,而是模型可部署能力的一部分。
为权利账而设计
严肃的数据程序应当把权利账和词元账放在一起:
- 来源身份与采集日期;
- 许可证、条款、同意信号和法域;
- 转换历史、过滤、去重和 PII 处理;
- 预训练、微调、RAG(检索增强生成,即在查询时取回文档再喂给模型的模式,见 第 44 章)、评测和展示的允许用途;
- 能展示给客户、审计者和监管者的文档。
技术栈已经有地方承载这本账:第 6 章 处理质量与过滤,第 59 章 处理来源、隐私与删除,第 61 章 则承接法律义务。本章补上的经济命题是:这本账之所以有价值,是因为它把数据从有风险的输入变成可销售的输入。
延伸阅读
- Longpre et al., “The Data Provenance Initiative: A Large Scale Audit of Dataset Licensing and Attribution in AI” (大规模数据集来源和许可审计), 2023. arXiv:2310.16787Data Provenance Initiative 审计超过 1800 个文本数据集,发现许可证缺失、许可证错误和商业可用数据访问不均。
- Longpre et al., “Consent in Crisis: The Rapid Decline of the AI Data Commons” (网页域名同意信号的纵向审计), 2024. arXiv:2407.14933这项对 14000 个网页域名的审计发现 AI 专用限制快速增长,许多重要 C4 来源通过 robots.txt 或服务条款变为受限。
- Alsup, “Bartz v. Anthropic PBC, Order on Fair Use, No. 3:24-cv-05417 (N.D. Cal.)” (在合法获得的书上训练构成合理使用;留存盗版副本则不构成), 2025. docs.justia.comAlsup 法官裁定,用合法获得的书籍训练大语言模型属于高度转化性的合理使用,而下载并长期留存数百万本影子图书馆盗版书则不属于。
- Chhabria, “Kadrey v. Meta Platforms, Inc., Order on Summary Judgment, No. 3:23-cv-03417 (N.D. Cal.)” (因未能证明市场损害而认定训练构成合理使用,附带市场稀释的附论), 2025. law.justia.comChhabria 法官就大语言模型训练的合理使用问题作出有利于 Meta 的简易判决,同时在附论中指出,若原告充分举证市场稀释,结果可能不同。
- European Commission, “Guidelines for Providers of General-Purpose AI Models” (GPAI 义务自 2025 年 8 月 2 日起生效,须按欧盟委员会模板发布公开的训练内容摘要), 2025. digital-strategy.ec.europa.eu欧盟委员会面向 AI Act 下 GPAI 提供者的指引:义务自 2025 年 8 月 2 日起适用,执法权自 2026 年 8 月起生效,提供者须按官方模板发布训练内容摘要。
- European Commission, “The General-Purpose AI Code of Practice” (面向安全、透明和版权义务的自愿合规工具), 2025. digital-strategy.ec.europa.eu欧盟委员会 GPAI 行为准则为模型提供者提供自愿路径,以证明其满足 AI Act 下透明、版权和系统性风险安全义务。
- Open Source Initiative, “The Open Source AI Definition 1.0” (开源 AI 自由与必要修改材料), 2024. opensource.orgOSI 定义要求使用、研究、修改和分享自由,并把数据说明、代码与参数视为修改 AI 系统的首选形式。
评论
登录后评论