数据集许可证漂移
数据集许可证漂移是一个操作性审计概念:数据从原始来源进入 collection、镜像、聚合数据集、模型与下游应用后,界面或元数据所显示的许可类别、权利范围、归属信息或义务,逐步遗漏、替换或变得比根来源更宽松。它描述的是证据链变化,不是已经统一定义的法律术语,也不自动证明侵权。
许可证漂移至少涉及六种不能混为一谈的范围:数据内容许可、数据库权利、代码许可、模型许可、访问/使用条款,以及隐私、同意与再分发限制。一个仓库写有 MIT 或 Apache-2.0,最多先证明某个 artifact 的声明;不能据此把仓库内第三方数据、个人信息或上游内容一起重许可。
相邻概念不能互换
| 现象 | 可观察到什么 | 不能直接推出什么 |
|---|---|---|
| 许可缺失 | card、仓库或索引没有许可字段 | 数据必然不可用,或已进入公有领域 |
| 标签不一致 | 平台标签与原作者/根来源许可类别不同 | 哪一方在法律上最终正确 |
| 漂移 | 许可、归属或限制沿供应链丢失或改变 | 漂移必然是故意行为 |
| 许可证洗白 | 限制性或不明来源在下游呈现为更宽松许可 | 只凭一个标签即可判定违法 |
| permissive washing | 表面是宽松标签,但缺少完整许可文本与版权/归属 payload | 所有宽松许可项目都不合规 |
这里的关键不是“有没有一个 license 字符串”,而是该字符串由谁声明、针对什么对象、对应哪个版本、是否继承根来源义务,以及能否回到可核查的权利主体。
形成机制
- 范围错配。 GitHub 的项目 LICENSE 往往覆盖代码;数据 card 的字段针对数据;网站 Terms 约束访问。界面把它们并列展示时,用户容易把“代码开源”读成“数据可再分发”。
- 组合数据集压平来源。 collection 可能把多个 constituent datasets、模板、过滤版本和派生物压成一行标签;若只记录直接父节点,根来源限制会消失。
- 镜像与重包装。 镜像作者可能复制文件却不复制许可文本、版权声明、同意限制或 attribution;也可能给仓库加一个只适用于包装代码的宽松许可。
- 自报元数据与平台推断。 Hugging Face 官方文档把Hugging Face 数据集卡片的
license定义为仓库维护者提供、供展示与筛选的 README YAML 元数据,未将其表述为平台权利链认证。GitHub License API 则由 Licensee 对仓库约定位置/命名的许可文件做已知许可证匹配;它不分析依赖许可,也可能漏掉文档其他位置的说明,因此检测结果不是仓库全部法律状态。 - 版本漂移。 card、schema、标签和仓库内容都可修改;不记录 revision、访问日期和解析器版本,今天的标签无法复现过去的判断。
- 模型与应用继续传播。 数据来源只在少数模型卡中披露;模型进入 GitHub 应用后,应用自身许可证可能成为界面中唯一可见的许可信息,遮蔽或遗漏上游数据与模型义务,但这不代表法律上取代这些义务。这会形成机器学习供应链的证据断链。
2024 年 Data Provenance 审计
Longpre 等人的 Nature Machine Intelligence 研究由 Data Provenance Initiative 建立 DPCollection,审查的是 44 个经专家选择、较流行的 instruction/alignment fine-tuning collections 中 1,858 条 constituent-dataset records。collections 之间存在数据集与样本重叠,作者为保留模板、格式和过滤差异而没有去重。因此它既不是 1,858 个唯一数据集,也不是 Hugging Face 全站的随机样本。
研究先汇集 GitHub、arXiv、Hugging Face、Papers with Code 与 collection 自报信息,再寻找 data-specific license、排除仅适用于代码的许可,沿 permitted use、attribution、share-alike 三维分类,并追溯 derivation roots。多个许可并存时逐维取最严格口径。法律专业人士设计 guided workflow,AI 领域专家(博士生与博后)阅读来源;GPT-4 仅在来源追踪环节作为 4,000 字符论文片段的检索辅助,不负责最终许可证判断。结果是 best-effort operational taxonomy,不是法院裁判。
Table 2 的可复算口径
| 平台快照 | 未指定 | 与审计分类不一致 | 过度宽松 |
|---|---|---|---|
| GitHub | 1,339 / 1,858 = 72.07% | 1,051 / 1,858 = 56.57% | 544 / 1,858 = 29.28% |
| Hugging Face | 1,289 / 1,858 = 69.38% | 1,203 / 1,858 = 64.75% | 505 / 1,858 = 27.18% |
| Papers with Code | 1,299 / 1,858 = 69.91% | 857 / 1,858 = 46.12% | 296 / 1,858 = 15.93% |
“过度宽松”的分母是全部 1,858 条,不是只有已标许可的子样本。常被转述的 29% 只对应 GitHub;Hugging Face 是 27.18%。论文正文把 Hugging Face 不一致写成 66%,但 Table 2 可复算为 64.75%(约 65%);截至 2026-08-10 未找到 correction,应保留这一内部不一致,而不能选一个数字伪装成精确共识。
DPCollection 的最终人工类别为 commercial 856、unspecified 570、non-commercial 352、academic-only 80。作者仓库的 Apache-2.0 声明明确针对 code;文章本身为 CC BY 4.0。这两者都不能把底层第三方数据或逐条来源自动重许可。
Artifact 的版本边界
最早的 initial-push commit 6f964462… 含恰好 44 个非模板 collection JSON、合计 1,858 条记录,是最接近论文 cohort 的固定快照,但当时许可常量顺序与后续 resolver 不同,朴素复算与最终表仍差一条记录。v1.1.0 commit 1423e54… 已混入后续 text、speech、video 扩展。没有找到带 DOI/Zenodo、同时封装 exact-final Table 2 输入与解析器的不可变复制包;Data Provenance Explorer也不能代替这项 provenance 缺口。
独立外部证据
截至 2026-08-10,没有找到一个无原作者重叠的研究,按同一 44 collections/1,858 records,逐项回溯原作者许可并同时复跑 GitHub、Hugging Face、Papers with Code。现有证据支持漂移机制与部分数量级,但不是对原表的完整独立复制。
| 研究 | 外部发现 | 可支持的结论 | 边界 |
|---|---|---|---|
| Osborne、Ding、Kirk(2024) | 2023-10 Hugging Face API 快照中,65,761 个 datasets 有 72.13% 无 license tag | 平台级许可缺失与 69–72% 的量级相符 | 只读自报元数据,不追原作者许可 |
| Yang、Liang、Zou(ICLR 2024) | 24,065 个 dataset repos 中,非空 card 仅 7,433(30.9%),却承载 95.0% 下载 | 结构化元数据稀疏且流量高度集中 | 不是许可真伪审计 |
| Pepe 等(ICPC 2024) | 159,132 个模型中 14.08% 有 dataset tag;发现 707 个“限制模型→宽松 GitHub 项目”的潜在错配实例 | 标签/许可可沿 model→app 链变化 | 是否构成衍生作品取决于具体使用与法域 |
| Pepe 等(EMSE 2026) | 2024-09 快照含 898,718 个模型,dataset tag 约 9.20%;发现 7,834 条限制模型→宽松应用 usage pairs | 2024-09 第二快照仍显示披露缺口,且有纵向复制包 | 新样本加入 Diffusers 且平台扩张,不能把 707→7,834 当纯时间趋势 |
| Katzy 等(FORGE 2024) | The Stack v1、The Pile、CodeParrot 均有强 copyleft 文件精确重合或许可首部 | 经审计的聚合语料即使采用仓库级许可过滤,仍含 file-level 强 copyleft 信号 | 哈希重合不证明复制方向、唯一许可、因果性的“丢失”或侵权 |
| Jewitt 等(KDD 2026) | 在 28,724 条全宽松链涉及的 1,015 个 datasets 和 4,077 个 models 中,分别有 96.5% 和 95.8% 缺完整许可文本;任一关联上游 notice 到 app 的保留率仅 6.38% | tag 不等于可执行的合规 payload,归属会在重包装中丢失 | 只审可连成链的流行样本和宽松许可 payload |
| Jewitt 等(2026 preprint) | 232,270 条链中 62.3% 至少一环 Unknown;全 Known 链中 37.5% 丢至少一类许可 | 类别漂移有大样本后续证据 | 与上一行同一团队,不能算第二个独立团队;论文引用前作估计仅 7.1% 的 Hugging Face 模型声明训练数据 |
这些后续也给出重要反例:在 fully-known chains 中,Permissive 类别端到端保留率为 95.1%,而 ShareAlike 仅 4.7%。漂移明显不对称,不能写成“所有许可都会随机消失”。KDD 研究还发现下游 app 自己的许可文本与版权信息完整率较高,但这不等于它保留了上游 notice。
The Common Pile采用 Data Provenance 方法筛选许可来源,但作者中有 Shayne Longpre、Enrico Shippole 与原研究重叠,只能算作者延伸采用,不能算独立复现。Papers with Code 的 2023 快照也不能与当前已重定向的 URL 直接作纵向比较。
三个多重范围案例
- FineWeb card 标
odc-by,并说明 Common Crawl 的 Terms of Use 同时适用;其关联处理代码 DataTrove 仓库 另为 Apache-2.0。只有把三种 scope 分开,才能避免把 pipeline code 的许可覆盖到网页内容。 - 截至本次审计,Hugging Face 的
bookcorpus/bookcorpus仓库标为unknown,而若干镜像标为 MIT。这个差异是BookCorpus的高风险审计信号,但仅凭标签不能确定镜像是否取得额外授权。 - 截至审计 revision,
stanfordnlp/imdbYAML 为license: [other],正文仍写More Information Needed,且未给license_name/license_link。IMDb 数据集的other只是自报分类,不能承担自动合规判断。
Open Data Commons等标准许可能降低语义含混,却仍要求审计者确认许可主体、对象、版本与上游内容权利。
可执行的许可账本
一个可审计的数据/模型 pipeline 至少应保存:
- source identity、稳定 URL、版本/commit/snapshot 日期和内容哈希;
- publisher-declared、platform-observed、auditor-concluded 三列,分别记录声明、界面事实与审计判断;
- 数据内容、数据库、代码、模型、访问条款、隐私/同意六个 scope,禁止用一个字段互相覆盖;
- 每条 dependency edge 的 root sources、继承义务、attribution、share-alike、商业/研究限制;
- Hugging Face
unknown、Hugging Face 字段缺失、SPDXNONE、SPDXNOASSERTION与抓取失败的区别,以及判断者、日期、置信度和证据 URL; - schema 与解析器版本,使历史标签能重放而不是被当前页面覆盖。
SPDX 3.0 Dataset profile 可以分别表达 declared 与 concluded license;在相应 SPDX 2.x 字段中,NONE 和 NOASSERTION 的语义也不应合并。SPDX 文档里的 dataLicense 是 metadata document 自身的许可,并不自动描述其中的数据集。CycloneDX 的 ML-BOM 可记录模型、数据和依赖组件;两者都属于证据载体,而不是权利主体真实性的证明。将这些字段纳入AI/ML 物料清单,能让审计从“读一个 badge”转向可追踪的供应链账本。
对平台与具身智能数据的含义
Hugging Face Content Policy处理平台允许什么内容,不负责替仓库作者证明数据权利;Hugging Face 服务条款要求用户对上传与使用承担相应责任。Hugging Face Gated Repositories只改变访问控制,不能修复根来源、再分发或同意链。
在具身智能数据基础设施中,视频、机器人遥操作、第三方数据、自动标注、仿真资产、模型权重和训练代码经常来自不同主体。公开下载、代码开源、模型卡可见与数据可再分发必须分别判断。最稳健的表述不是“这个仓库是 Apache,所以数据开放”,而是“某一具体 artifact 在某一 revision 下作了某种声明;其上游权利链与未覆盖 scope 仍需逐项核验”。
证据边界与重开条件
- 现有证据强支持:许可缺失、类别不一致、归属 payload 丢失和 model→app 标签漂移真实存在。
- 现有证据不支持:全部 Hugging Face 仓库的真实法律状态、Papers with Code 的当前误标率、任何单个数据集必然侵权,或一次标签扫描足以给出法律结论。
- 若出现 exact-final Table 2 的不可变 artifact、无作者重叠的同协议复跑、逐法域判例,或平台开始提供签名 provenance/历史 revision 账本,应重新评估数字与机制。
相关页面
- Hugging Face 数据集卡片
- Hugging Face Content Policy
- Hugging Face 服务条款
- Hugging Face Gated Repositories
- 机器学习供应链
- AI/ML 物料清单
- 具身智能数据基础设施
证据
- 原始资料快照(本地归档)
- Longpre et al., A large-scale audit of dataset licensing and attribution in AI (Nature Machine Intelligence, 2024)
- Data Provenance Collection repository
- Hugging Face dataset-card metadata documentation
- GitHub REST license endpoint boundary
- Osborne et al., JCSS 2024
- Yang et al., ICLR 2024
- Pepe et al., ICPC 2024
- Pepe et al., EMSE 2026;replication package
- Katzy et al., FORGE 2024
- Permissive-Washing, ACM KDD 2026
- Don’t Trust the Label (2026 preprint);License Laundering replication package
- SPDX 3.0 Dataset profile
- CycloneDX ML-BOM