数据权利与合规经济
技术上能够获取的数据,不代表在权利上已经可以使用。反过来,缺少许可证也不自动等于某项法律结论。权利是否完备,是一项有日期的判断,必须对应具体的数据快照、拟议用途、处理主体、司法辖区、模型或产品版本和复核日期。它不是字节本身的属性。
这个区别会改变数据的经济价值。数据可以反复复制和使用,不会像实物那样被消耗,但访问权、合同授权、隐私许可和某些法律权利仍可能具有排他性或附带条件。因此,真正有价值的资产不只是一套庞大语料,而是一套已经对应可辩护判断、有效控制和发布复核证据的语料。本章给出这项判断的运行模型,不构成法律意见。具体法律定性应由合格法律顾问按照 第 61 章 所述的司法辖区流程完成。
先明确用途,再审查数据
「这套数据能不能用?」并不是一个完整问题。预训练、微调、评测、检索、输出展示、再分发、日志与反馈,以及生成合成资产和衍生资产,可能得到不同答案。产品、客户类别、地域、期限和实际处理数据的一方发生变化时,答案也可能变化。
先写出具体用途声明:由这个主体采集的这个资产版本,将以这种方式处理,用于这个产品和发布版本,在这些司法辖区和这段期间内使用。然后把准入写成明确的门禁:
式中, 是资产快照, 是拟议用途, 是司法辖区, 是模型或产品发布版本, 是复核时间。 表示来源和血缘信息已经完整到足以复核。 表示经批准的法律依据、许可或例外覆盖了已经声明的事实。 表示相关义务、权利保留和合同条款均有记录。 表示所需技术控制已经实现。 表示当前发布证据已经把这项判断与资产和构建版本关联起来。这是组织内部的发布准入规则,不是通用法律测试。任一条件不满足时,应拒绝、隔离或转交复核,而不是让工程师自行创造法律结论。
把证据与决策分开
一套有用的权利账要把五个层面分开:
- **来源事实:**来源 URI、采集者、日期、内容哈希、资产版本、转换和衍生关系。来源只能说明资产来自哪里,不能证明已经获得许可。
- **法律判断:**所有权或其他法律依据、许可证、合同、相关法定例外、隐私依据、司法辖区、复核者和所依据材料的版本。
- **组织政策:**对客户作出的承诺、排除的数据来源类别、审批门槛和具名的风险接受人。政策可以比法律更严格,但不会因此变成法律。
- **技术控制:**允许列表、采集规则、过滤器、访问控制、署名、保留、删除和发布拦截。
- **发布证据:**归档的来源材料、签署条款、复核记录、控制测试、语料清单、模型关联关系、批准人和到期日期。
把这些层面混在一起会制造虚假的确定性。许可证标签可能有误,合同可能只允许部分用途,技术拦截可以执行政策,却不能说明法律依据。反过来,法律判断只有经过测试的控制落实到语料、索引、模型工作流和发布流程中,才真正可执行。
不同信号不能混为一谈
许可证、服务条款、版权权利保留、隐私同意和访问控制回答的是不同问题。Robots 排除协议是一套表达爬虫偏好的协议。RFC 9309 明确指出,它不是访问授权,也不能替代安全措施 (Koster et al. 2022)。应把 robots.txt 规则及其采集时间记录为观察到的信号,不能把它当作所有权证明、隐私同意或完整的法律判断。
司法辖区同样重要。欧盟《数字单一市场版权指令》第 4 条规定,在其文本与数据挖掘例外中,以适当方式表达的机器可读权利保留具有相关性 (European Parliament and Council of the European Union 2019)。这并不意味着每一条爬虫规则都会成为世界范围内的禁止。服务条款、版权、许可证范围、隐私同意或其他隐私依据,以及访问控制,仍是彼此独立的判断,不能互相替代。
两项审计说明了为什么证据层不可省略。Data Provenance Initiative 审查了 44 个常用的对齐微调数据集合,其中包含超过 1,800 个文本数据集,实际为 1,858 个。在三个托管平台上,样本的部分范围内有超过 70% 的许可证字段没有填写;平台标签与人工复核的一致率只有 35% 至 54%,部分审计范围内的错误率超过 50% (Longpre et al. 2023)。这些是关于选定数据集元数据的发现,并不是对所有数据集作出的法律结论。
《Consent in Crisis》研究了 C4、RefinedWeb 和 Dolma 所涵盖的 14,000 个网站域名。截至 2024 年 4 月,服务条款限制了约 45% 的 C4 词元;完全限制性的爬虫规则覆盖比例较小,却增长很快。论文报告的是,如果这些限制得到遵守或执行,会发生什么变化,并明确指出没有限制并不代表已经同意 (Longpre et al. 2024)。这些观察到的信号不是法律结论,而且网站运营者未必拥有网站上每一项作品的权利。
评估权利完备的数据选项,而不是词元堆
权利工作会产生成本,也可能创造选择权,例如打开一个市场、通过购买方的采购门禁,或让模型更早发布。应在同一个核算期 内,把候选数据集 与最佳可行基线比较:
式中, 是增量净收益。 表示产品价值、模型表现、交付速度,或由此新增的市场和客户类别所带来的变化。 是采购与版税成本; 是法律与运营审查成本; 是落实各项义务的成本; 用于生成可供复核的记录; 用于续约与变化监测。 表示相对基线而言,法律、合同、隐私、补救和声誉损失的预期变化。
每一项都要采用同一种货币和同一个核算期,摊销共享成本,并明确写出基线。不要把同一项市场准入收益既算作收入,又算作避免损失。不能让步的隐私、安全和法律限制应作为护栏保留,而不是为了计算方便给它们随意定价。许可证费用不是数据集的内在价值,也不是每词元价格。它反映的是一整套谈判结果,包括内容、访问方式、许可用途、服务、排他性、期限、保证和议价能力。
Reddit 在 2024 年的招股说明书中披露了这类组合。文件列出数项在 2024 年 1 月签订的数据许可安排,交易价格合计 2.03 亿美元,期限为两年至三年,预计 2024 年收入至少为 6,640 万美元。几乎全部合同价值来自同一家合作方,但文件没有披露其名称 (Reddit, Inc. 2024)。这项披露可以证明市场交易确实存在,却不是单位价格、Google 专属价格,也不能证明每个语料库都有相近价值。
法院判决不会给出全球统一价格
2025 年 6 月,加利福尼亚北区联邦地区法院的两名法官分别作出针对具体案卷事实的地区法院裁定,而不是全国性规则。在 Bartz v. Anthropic 中,法院根据该案记录认定用于训练模型的复制构成合理使用,但把从盗版来源取得并长期保存在永久通用图书馆中的书籍副本分开处理,并将该用途留待审判 (Alsup 2025)。在 Kadrey v. Meta 中,法院就具名作者提出的复制与训练主张判决 Meta 胜诉,但强调原告没有提出有意义的市场损害证据,并结合被主张的训练目的分析影子图书馆下载行为 (Chhabria 2025)。两份裁定的分析不同,案件事实、原告、市场和诉讼程序阶段也不同,不能为其他模型、媒介、输出或案卷建立通用规则。两份裁定都不支持「只要合法取得材料,训练就一定构成合理使用」这条捷径。
Bartz 在剩余问题开庭前达成和解。2026 年 7 月 20 日,法院最终批准一项不返还的 15 亿美元集体和解,覆盖 482,460 部列明作品 (Martínez-Olguín 2026)。协议解决截至 2025 年 8 月 25 日的特定既往主张,不许可未来行为,也不免除输出相关主张。和解不是判例、上诉法院判决、责任承认,也不是经过裁判确定的训练价格。
合规可以打开市场
对于在欧盟提供通用人工智能模型的提供商,《人工智能法》第 53 条要求提供技术文档、面向下游提供商的信息、版权政策与合规流程,以及按照欧盟委员会模板编写的公开训练内容摘要 (European Parliament and Council of the European Union 2024)。第五章义务自 2025 年 8 月 2 日起适用于从该日起投放市场的模型;欧盟委员会的执法权,包括第 101 条所涉罚款,自 2026 年 8 月 2 日起适用。对于 2025 年 8 月 2 日之前已经投放市场的模型,提供商最迟应在 2027 年 8 月 2 日前合规。
《通用人工智能行为准则》是自愿性合规工具,不是法律本身。其中的透明度和版权章节用于支持第 53 条义务,安全与安保章节则适用于具有系统性风险的通用人工智能模型提供商 (European Commission 2025)。欧盟条例 2026/1744 调整了部分高风险系统的期限,但没有推迟 GPAI 相关日期 (European Parliament and Council of the European Union 2026)。具体细节、例外、角色和过渡时间表见 第 61 章。
文档本身不能保证合规。但从经济角度看,当前有效的证据和控制可以让产品进入原本关闭的客户、地区和受监管采购渠道。应当测量这部分增量准入价值,不能把文书工作本身改称为价值。
开源回答的是另一个问题
开放源代码促进会的《开源 AI 定义 1.0》要求使用者有使用、研究、修改和分享 AI 系统的自由。其首选修改形式包括代码、参数和足够详细的数据信息,使具备相应技能的人可以构建实质等效的系统 (Open Source Initiative 2024)。这些信息包括训练数据、来源、筛选、处理方式和可获取位置的说明。如果底层数据无法再分发,这一定义不一定要求公开训练数据集本身。
因此,仅有权重不符合这一定义。更重要的是,系统被归类为开源,不能据此判断数据获取与处理是否符合版权、合同、隐私或行业义务。开放性、可复现性和权利完备性彼此重叠,却不能互相证明。
按发布版本持续维护权利账
不要保存一个全局的 usable = true。应针对由资产、用途、产品、地区、客户类别和时间组成的版本化元组,记录允许、拒绝或复核决定。权利账及其测试至少要覆盖:
- **身份:**来源 URI、快照哈希、采集主体和日期、转换记录、衍生数据集、索引和模型;
- **决定:**法律依据和复核者、授权方的权限、许可证或合同、权利保留、隐私依据和组织政策;
- **范围:**按产品和接收方记录预训练、微调、评测、检索、展示、再分发、日志、反馈,以及合成或衍生用途;
- **义务:**地域、期限、署名、付款、相同方式共享、再分发、保证、赔偿、审计、保留、删除和终止;
- **执行:**采集与访问控制、过滤、署名、到期拦截、删除传播、证据测试、批准人和下次复核日期。
当来源条款变化、权利保留信号出现、合同到期、收到删除或撤回请求、提出新的用途、模型、发布版本或市场,或者供应商变化改变处理链时,都要重新执行准入判断。删除也必须说明范围。删除源记录、从未来语料和检索索引中移除,以及修复已经训练的模型,是三种不同的操作,详见 第 59 章。
更严格的访问限制可以改善付费、来源记录和创作者控制,同时也会提高进入壁垒,让有能力支付大额交易的企业更容易集中有价值的语料。更宽泛的例外可以支持研究、竞争和新产品,却会让创作者和下游购买方承担更多不确定性。争议不只在于训练是否创造价值,还在于哪些权利适用、谁有权授予这些权利、谁承担审查与执行成本,以及这些选择会如何分配市场力量。
权利账从 第 6 章 的采集与质量控制开始,并依赖 第 59 章 的来源、隐私、保留和删除机制。法律判断来自 第 61 章。向上看,它决定哪些产品和地区可以进入 第 77 章 的市场分析。权利证据是可部署能力的一部分,不是模型建成后才附加的元数据。
延伸阅读
- Longpre et al., “The Data Provenance Initiative: A Large Scale Audit of Dataset Licensing & Attribution in AI” (数据集许可、来源与署名审计), 2023. arXiv:2310.16787Data Provenance Initiative 审计超过 1800 个文本数据集,发现广泛的许可证缺失、许可证错误,以及商业开放数据和闭合数据之间的分化。
- Longpre et al., “Consent in Crisis: The Rapid Decline of the AI Data Commons” (对 14000 个网页域名限制信号的纵向审计), 2024. arXiv:2407.14933追踪主要网页语料所含域名的 robots 与服务条款信号变化,并将这些信号与法律同意区分开来。
- Koster et al., “Robots Exclusion Protocol” (明确 robots 规则不是访问授权的协议规范), 2022. rfc-editor.org将 robots.txt 标准化为爬虫偏好协议,并明确区分于访问授权。
- Alsup, “Bartz v. Anthropic PBC, Order on Fair Use, No. 3:24-cv-05417” (将训练副本与通用资料库中留存的盗版来源图书区分处理的地区法院裁定), 2025. govinfo.gov认定案卷中的模型训练使用构成合理使用,同时将盗版来源图书的永久资料库用途留待审理。
- Chhabria, “Kadrey v. Meta Platforms, Inc., Order on Summary Judgment, No. 3:23-cv-03417” (强调具名原告市场损害证据不足的地区法院合理使用裁定), 2025. law.justia.com就具名作者的复制与训练主张判 Meta 胜诉,同时强调缺乏有意义的市场损害证据。
- European Parliament and Council of the European Union, “Regulation (EU) 2024/1689 Laying Down Harmonised Rules on Artificial Intelligence” (欧盟《人工智能法》的《官方公报》文本), 2024. eur-lex.europa.eu规定具有约束力的欧盟框架,包括通用人工智能模型提供者的第 53 条义务和第 113 条过渡日期。
- European Commission, “The General-Purpose AI Code of Practice” (面向透明、版权及系统性风险安全与安保义务的自愿合规工具), 2025. digital-strategy.ec.europa.eu为证明特定 GPAI 透明、版权、安全与安保义务提供自愿路径。
- Open Source Initiative, “The Open Source AI Definition 1.0” (定义开源 AI 的自由与可修改首选形式), 2024. opensource.orgOSI 定义把开源 AI 视为需要使用、研究、修改和分享四项自由,并要求数据说明、代码与参数以便于修改的首选形式提供。
- European Commission, “Guidelines for Providers of General-Purpose AI Models” (关于 GPAI 模型范围和提供者义务的不具约束力的欧盟委员会指引), 2025. digital-strategy.ec.europa.eu说明欧盟委员会对 AI Act 下 GPAI 模型与提供者概念的预期解释。
评论
登录后评论