数据集许可证漂移

数据集许可证漂移是一个操作性审计概念:数据从原始来源进入 collection、镜像、聚合数据集、模型与下游应用后,界面或元数据所显示的许可类别、权利范围、归属信息或义务,逐步遗漏、替换或变得比根来源更宽松。它描述的是证据链变化,不是已经统一定义的法律术语,也不自动证明侵权。

许可证漂移至少涉及六种不能混为一谈的范围:数据内容许可、数据库权利、代码许可、模型许可、访问/使用条款,以及隐私、同意与再分发限制。一个仓库写有 MIT 或 Apache-2.0,最多先证明某个 artifact 的声明;不能据此把仓库内第三方数据、个人信息或上游内容一起重许可。

相邻概念不能互换

现象 可观察到什么 不能直接推出什么
许可缺失 card、仓库或索引没有许可字段 数据必然不可用,或已进入公有领域
标签不一致 平台标签与原作者/根来源许可类别不同 哪一方在法律上最终正确
漂移 许可、归属或限制沿供应链丢失或改变 漂移必然是故意行为
许可证洗白 限制性或不明来源在下游呈现为更宽松许可 只凭一个标签即可判定违法
permissive washing 表面是宽松标签,但缺少完整许可文本与版权/归属 payload 所有宽松许可项目都不合规

这里的关键不是“有没有一个 license 字符串”,而是该字符串由谁声明、针对什么对象、对应哪个版本、是否继承根来源义务,以及能否回到可核查的权利主体。

形成机制

  1. 范围错配。 GitHub 的项目 LICENSE 往往覆盖代码;数据 card 的字段针对数据;网站 Terms 约束访问。界面把它们并列展示时,用户容易把“代码开源”读成“数据可再分发”。
  2. 组合数据集压平来源。 collection 可能把多个 constituent datasets、模板、过滤版本和派生物压成一行标签;若只记录直接父节点,根来源限制会消失。
  3. 镜像与重包装。 镜像作者可能复制文件却不复制许可文本、版权声明、同意限制或 attribution;也可能给仓库加一个只适用于包装代码的宽松许可。
  4. 自报元数据与平台推断。 Hugging Face 官方文档把Hugging Face 数据集卡片的 license 定义为仓库维护者提供、供展示与筛选的 README YAML 元数据,未将其表述为平台权利链认证。GitHub License API 则由 Licensee 对仓库约定位置/命名的许可文件做已知许可证匹配;它不分析依赖许可,也可能漏掉文档其他位置的说明,因此检测结果不是仓库全部法律状态。
  5. 版本漂移。 card、schema、标签和仓库内容都可修改;不记录 revision、访问日期和解析器版本,今天的标签无法复现过去的判断。
  6. 模型与应用继续传播。 数据来源只在少数模型卡中披露;模型进入 GitHub 应用后,应用自身许可证可能成为界面中唯一可见的许可信息,遮蔽或遗漏上游数据与模型义务,但这不代表法律上取代这些义务。这会形成机器学习供应链的证据断链。

2024 年 Data Provenance 审计

Longpre 等人的 Nature Machine Intelligence 研究由 Data Provenance Initiative 建立 DPCollection,审查的是 44 个经专家选择、较流行的 instruction/alignment fine-tuning collections 中 1,858 条 constituent-dataset records。collections 之间存在数据集与样本重叠,作者为保留模板、格式和过滤差异而没有去重。因此它既不是 1,858 个唯一数据集,也不是 Hugging Face 全站的随机样本。

研究先汇集 GitHub、arXiv、Hugging Face、Papers with Code 与 collection 自报信息,再寻找 data-specific license、排除仅适用于代码的许可,沿 permitted use、attribution、share-alike 三维分类,并追溯 derivation roots。多个许可并存时逐维取最严格口径。法律专业人士设计 guided workflow,AI 领域专家(博士生与博后)阅读来源;GPT-4 仅在来源追踪环节作为 4,000 字符论文片段的检索辅助,不负责最终许可证判断。结果是 best-effort operational taxonomy,不是法院裁判。

Table 2 的可复算口径

平台快照 未指定 与审计分类不一致 过度宽松
GitHub 1,339 / 1,858 = 72.07% 1,051 / 1,858 = 56.57% 544 / 1,858 = 29.28%
Hugging Face 1,289 / 1,858 = 69.38% 1,203 / 1,858 = 64.75% 505 / 1,858 = 27.18%
Papers with Code 1,299 / 1,858 = 69.91% 857 / 1,858 = 46.12% 296 / 1,858 = 15.93%

“过度宽松”的分母是全部 1,858 条,不是只有已标许可的子样本。常被转述的 29% 只对应 GitHub;Hugging Face 是 27.18%。论文正文把 Hugging Face 不一致写成 66%,但 Table 2 可复算为 64.75%(约 65%);截至 2026-08-10 未找到 correction,应保留这一内部不一致,而不能选一个数字伪装成精确共识。

DPCollection 的最终人工类别为 commercial 856、unspecified 570、non-commercial 352、academic-only 80。作者仓库的 Apache-2.0 声明明确针对 code;文章本身为 CC BY 4.0。这两者都不能把底层第三方数据或逐条来源自动重许可。

Artifact 的版本边界

最早的 initial-push commit 6f964462… 含恰好 44 个非模板 collection JSON、合计 1,858 条记录,是最接近论文 cohort 的固定快照,但当时许可常量顺序与后续 resolver 不同,朴素复算与最终表仍差一条记录。v1.1.0 commit 1423e54… 已混入后续 text、speech、video 扩展。没有找到带 DOI/Zenodo、同时封装 exact-final Table 2 输入与解析器的不可变复制包;Data Provenance Explorer也不能代替这项 provenance 缺口。

独立外部证据

截至 2026-08-10,没有找到一个无原作者重叠的研究,按同一 44 collections/1,858 records,逐项回溯原作者许可并同时复跑 GitHub、Hugging Face、Papers with Code。现有证据支持漂移机制与部分数量级,但不是对原表的完整独立复制。

研究 外部发现 可支持的结论 边界
Osborne、Ding、Kirk(2024) 2023-10 Hugging Face API 快照中,65,761 个 datasets 有 72.13% 无 license tag 平台级许可缺失与 69–72% 的量级相符 只读自报元数据,不追原作者许可
Yang、Liang、Zou(ICLR 2024) 24,065 个 dataset repos 中,非空 card 仅 7,433(30.9%),却承载 95.0% 下载 结构化元数据稀疏且流量高度集中 不是许可真伪审计
Pepe 等(ICPC 2024) 159,132 个模型中 14.08% 有 dataset tag;发现 707 个“限制模型→宽松 GitHub 项目”的潜在错配实例 标签/许可可沿 model→app 链变化 是否构成衍生作品取决于具体使用与法域
Pepe 等(EMSE 2026) 2024-09 快照含 898,718 个模型,dataset tag 约 9.20%;发现 7,834 条限制模型→宽松应用 usage pairs 2024-09 第二快照仍显示披露缺口,且有纵向复制包 新样本加入 Diffusers 且平台扩张,不能把 707→7,834 当纯时间趋势
Katzy 等(FORGE 2024) The Stack v1、The Pile、CodeParrot 均有强 copyleft 文件精确重合或许可首部 经审计的聚合语料即使采用仓库级许可过滤,仍含 file-level 强 copyleft 信号 哈希重合不证明复制方向、唯一许可、因果性的“丢失”或侵权
Jewitt 等(KDD 2026) 在 28,724 条全宽松链涉及的 1,015 个 datasets 和 4,077 个 models 中,分别有 96.5% 和 95.8% 缺完整许可文本;任一关联上游 notice 到 app 的保留率仅 6.38% tag 不等于可执行的合规 payload,归属会在重包装中丢失 只审可连成链的流行样本和宽松许可 payload
Jewitt 等(2026 preprint) 232,270 条链中 62.3% 至少一环 Unknown;全 Known 链中 37.5% 丢至少一类许可 类别漂移有大样本后续证据 与上一行同一团队,不能算第二个独立团队;论文引用前作估计仅 7.1% 的 Hugging Face 模型声明训练数据

这些后续也给出重要反例:在 fully-known chains 中,Permissive 类别端到端保留率为 95.1%,而 ShareAlike 仅 4.7%。漂移明显不对称,不能写成“所有许可都会随机消失”。KDD 研究还发现下游 app 自己的许可文本与版权信息完整率较高,但这不等于它保留了上游 notice。

The Common Pile采用 Data Provenance 方法筛选许可来源,但作者中有 Shayne Longpre、Enrico Shippole 与原研究重叠,只能算作者延伸采用,不能算独立复现。Papers with Code 的 2023 快照也不能与当前已重定向的 URL 直接作纵向比较。

三个多重范围案例

Open Data Commons等标准许可能降低语义含混,却仍要求审计者确认许可主体、对象、版本与上游内容权利。

可执行的许可账本

一个可审计的数据/模型 pipeline 至少应保存:

  1. source identity、稳定 URL、版本/commit/snapshot 日期和内容哈希;
  2. publisher-declared、platform-observed、auditor-concluded 三列,分别记录声明、界面事实与审计判断;
  3. 数据内容、数据库、代码、模型、访问条款、隐私/同意六个 scope,禁止用一个字段互相覆盖;
  4. 每条 dependency edge 的 root sources、继承义务、attribution、share-alike、商业/研究限制;
  5. Hugging Face unknown、Hugging Face 字段缺失、SPDX NONE、SPDX NOASSERTION 与抓取失败的区别,以及判断者、日期、置信度和证据 URL;
  6. schema 与解析器版本,使历史标签能重放而不是被当前页面覆盖。

SPDX 3.0 Dataset profile 可以分别表达 declared 与 concluded license;在相应 SPDX 2.x 字段中,NONE 和 NOASSERTION 的语义也不应合并。SPDX 文档里的 dataLicense 是 metadata document 自身的许可,并不自动描述其中的数据集。CycloneDX 的 ML-BOM 可记录模型、数据和依赖组件;两者都属于证据载体,而不是权利主体真实性的证明。将这些字段纳入AI/ML 物料清单,能让审计从“读一个 badge”转向可追踪的供应链账本。

对平台与具身智能数据的含义

Hugging Face Content Policy处理平台允许什么内容,不负责替仓库作者证明数据权利;Hugging Face 服务条款要求用户对上传与使用承担相应责任。Hugging Face Gated Repositories只改变访问控制,不能修复根来源、再分发或同意链。

在具身智能数据基础设施中,视频、机器人遥操作、第三方数据、自动标注、仿真资产、模型权重和训练代码经常来自不同主体。公开下载、代码开源、模型卡可见与数据可再分发必须分别判断。最稳健的表述不是“这个仓库是 Apache,所以数据开放”,而是“某一具体 artifact 在某一 revision 下作了某种声明;其上游权利链与未覆盖 scope 仍需逐项核验”。

证据边界与重开条件

相关页面

证据