模型市场治理
模型市场治理是对模型、数据、代码、权重和应用在托管、展示、下载、运行和再分发过程中的风险分配与控制。它介于内容平台治理和软件供应链治理之间:模型仓库既承载文本、图像与社区互动,也承载可能在加载时执行代码、在部署后继续生成内容的制品。因此,许可证、click-through gate、内容标签、自动扫描、人工审核、下架和申诉都是必要工具,但任何一项都不能代替其他层,更不能单独充当“安全认证”。
为什么不能只叫内容审核
普通内容平台主要判断一段已发布内容是否应继续显示;模型市场还要处理至少四类不同对象:
- 权利与用途:上传者是否有权发布,下载者可以怎样使用、修改和再分发;
- 访问与传播:谁能看到页面、取得文件,是否按身份、地区、组织或审批状态放行;
- 制品执行风险:序列化文件、远程代码、插件、数据加载脚本和依赖是否会在下游执行;
- 生成与部署后果:模型被运行后是否产生违法、有害或侵犯权利的内容,以及平台还能控制哪些副本。
这也是 Gorwa 与 Veale 将 Hugging Face、GitHub 和 Civitai 称为 model marketplaces 时观察到的核心张力:模型既是需要审核的 artifact,又是生成后续内容和能力的工具。其比较主要覆盖 2022—2023 年政策与事件,只能支持治理形态,不是现行平台的效果排名。
三段治理链条
“预防式/反应式”二分会漏掉分发环节。更准确的是三段连续控制:
| 阶段 | 典型责任与工具 | 主要能控制 | 主要残余风险 |
|---|---|---|---|
| 生产端预防 | 安全序列化、最小权限、hash/签名、版本与血缘、训练数据与基础模型记录、许可证与 AUP、发布前评测 | 降低制品自身缺陷和来源不明 | metadata 可错、签名只证来源不证安全、行为条款仍需执行 |
| 分发前控制 | 上传扫描、隔离、人工复核、private/gated、身份或地域限制、模型权重分阶段发布、受众提示 | 降低未经审查取件和已知恶意载荷暴露 | scanner 有格式盲区与规避;gate 不约束站外副本或当然验证身份/用途 |
| 分发后响应 | 举报、unrank、disable/remove、撤权、账号措施、申诉、事故报告、规则更新 | 缩短仍由平台托管的暴露并修补已知规则 | 已下载文件、缓存、fork、镜像和衍生物不能被自动召回;相同代码可换仓复发 |
三段不是顺序替代关系。生产端使用 safetensors 可以缩小 Pickle 任意代码执行面,却不检查训练投毒、语义后门或许可证;平台扫描能提示风险,却不证明文件安全;下架能阻止后续托管访问,却不等于 外部副本召回。
工具之间的边界
| 工具 | 它回答的问题 | 不能据此推出 |
|---|---|---|
| license/LICENSE/card | 上传者声明哪些复制、修改、分发或使用条件 | 上传者拥有全部权利、上游兼容、标签没有漂移 |
| 基础模型可接受使用政策/行为使用许可证 | 哪些下游行为被合同或许可文本限制 | 平台可观测每次站外使用、违规会被发现或法院已确认条款效力 |
| public/private/gated | 当前页面和文件对哪些账号可见/可下载 | 获批即合规、身份与用途已审查、下载后可远程撤回 |
| Content Level/NFAA | 哪类受众或浏览偏好需要提示、遮挡或限制 | 年龄已经核验、内容被删除、artifact license 已改变 |
| hash/签名/revision | 文件是否与某个版本一致、发布者或提交来源是否可验证 | 该发布者可信、文件没有恶意行为;详见 模型制品签名与来源证明 |
| malware/Pickle/第三方扫描 | 特定格式与规则是否命中可疑代码、import、secret 或已知模式 | 未命中即安全、命中即真实恶意、告警一定被阻断或删除 |
| disable/remove/账号措施 | 平台是否停止当前托管访问或限制主体 | 历史副本消失、既有许可自动撤销、争议已有最终法律裁决 |
| 申诉与透明度报告 | 决定能否纠错、平台披露多少行动量 | 申诉推翻率等于整体误报率,行动量等于伤害减少量 |
Hugging Face Gated Repositories 的实时反例尤其清楚:EgoBrain 在 2026-08-10 的 API 状态是 gated:false,实际文件可匿名取得,但 card 仍自称 gated 并保留表单字段。字段、叙述与 server-side setting 会漂移;审计必须同时固定 revision、live state、访问日与实际文件响应。gate 变化也不会自动删除 card 上的 CC BY-NC 4.0 条件。
平台现状快照
Hugging Face:工具链最完整,但公开效果分母仍不足
Hugging Face Content Policy 区分 public、private、gated 和 disabled;owner-side gate、platform-side disable 和 artifact license 是不同动作。平台当前记录每次 commit 的 malware scan、Hugging Face Pickle Import Scanner、Protect AI/JFrog 等第三方结果、举报与人工审核,并可采取 unrank、NFAA、remove/disable、互动和账号措施。
官方 Protect AI 运营报告证明扫描在真实生产运行:截至 2025-04-01 覆盖 141 万 repositories、447 万 unique model versions,在 51,700 个 models 上标出 352,000 个 unsafe/suspicious issues。但这些是扫描覆盖和告警活动,不是“51,700 个恶意模型被删除”;报告没有恶意 ground truth、处置数、用户是否忽略告警或伤害结果。
Hugging Face DSA Transparency Report 2025 披露 5,859 项 solely automated measures、147,144 项非自动措施,以及 86 次内部投诉中的 24 次推翻。报告把 99.59 同时列作 accuracy、precision、recall,实质来自 24/5,859 的申诉翻转;没有 false-negative 分母便不能测 recall,三项也不是独立估计。该报告能证明治理动作和纠错存在,不能证明模型扫描或内容审核把实际伤害降低了 99.59%。
Civitai:内容分级、图像审核、许可与下载状态需分层
截至 2026-08-10,Civitai 的 ToS、early access、Bespoke License/模型状态是不同层。API 的 Published、Archived、TakenDown 表示平台托管状态;Archived 移除文件与下载 URL,TakenDown 进一步移除图像,但都不能召回站外副本。
Civitai Content Levels 所在的图像治理链包括 Amazon Rekognition 标签、自动筛选、社区投票和部分组合公开前人工复核。当前 ToS 已全面禁止 adult content 与真人 likeness,但固定源码仍保留 PG、PG-13、R、X、XXX、Blocked 常量;这只能写成政策文本与软件状态并存/迁移,不能据源码宣称生产站仍允许 X/XXX。未找到可固定的模型权重恶意载荷扫描、阈值、误报漏报或透明度统计,不能把图像审核写成权重安全检测。
ModelScope:私有仓申请、完整性与远程执行授权不是扫描
ModelScope 仓库内容治理 的公开 client 区分 PUBLIC、INTERNAL、PRIVATE;gated_mode/ProtectedMode 只对 private repo 生效,表示申请后下载,不是 Hugging Face 式“页面公开、artifact gated”。公开 client 未见同样的自定义申请字段或完整审批状态机。
ModelScope 远程代码执行授权 的 trust_remote_code 控制是否允许运行远程 code/plugin;SHA-256 校验控制下载完整性。两者都不能被表述为恶意权重、模型后门或内容合规扫描。本轮也未找到可靠官方材料支持统一 disabled/takedown 矩阵、恶意模型扫描效果或申诉透明度。
GitHub Models:已退役,只能作为历史案例
GitHub Models 退役(2026-07-30) 后,playground、catalog、inference API 和 BYOK 均不可用。GitHub Models Publisher Allowlist 与 GitHub Models 不可关闭内容过滤 只能解释退役前机制;通用 GitHub 透明度数据集 不是 Models 专项统计,repository 恶意代码扫描也不能倒灌为模型制品治理。现行 Marketplace Terms 仍残留 GitHub Models 引用而 Additional Products Terms 已删去对应小节,是文书漂移,不表示服务仍在线。
已有证据究竟证明了什么
能证明现实风险存在
MalHug 在 Hugging Face 镜像上持续三个月以上,覆盖约 70.6 万 models、17.6 万 datasets,发现 91 个恶意 models 和 9 个恶意 dataset-loading scripts。JFrog 也披露过真实 Pickle reverse shell。它们足以否定“模型文件只是被动数据”,但 observed finds 不是平台真实患病率,也没有给出下载后受害人数。
NullifAI broken-Pickle 漏检与修复事件 又证明 scanner 会漏检:恶意代码可在故意损坏的 Pickle 报 parser error 前执行。特定通报后,平台不足 24 小时移除并修改规则;这是一次快速响应,不是全平台 SLA。TrustBastion Hugging Face 恶意载荷托管与复发事件 则记录非 ML 权重的 Android RAT 在仓库消失后换仓复发,说明平台下架与供应链召回之间存在结构性缺口。
能比较检测器,却不能外推生产效果
PickleBall 安全加载器 在 252 个 benign 和 84 个 malicious 测试模型上阻止了测试集全部恶意 payload,但只正常加载 79.8% benign;约 2.62% 的运行开销并没有回答平台真实用户是否受益。ShadowPickle 扫描规避机制、SafePickle 等预印本继续展示不同 detector 的假阳性、假阴性、OOD 和规避差异;伦理上传的无害 payload 与作者 benchmark 不能被写成真实攻击患病率。
能证明文档与许可链不完整
Nature Machine Intelligence 对 1,858 个常用文本微调数据集的审计发现,聚合平台许可遗漏约 69%—72%,Hugging Face 标签与原作者许可用途类别不一致的比例为 66%,且常更宽松。这是目的性样本和 best-effort 法律编码,不是“66% 仓库违法”。ICPC 2024 的 159,132-model 样本中只有 14.08% 使用 machine-readable dataset tag;人工高下载样本有 58.09% 在某处提及数据,说明 tag 与文本披露也不能混作同一分母。
模型供应链 Ecosystem Graphs 与 AI/ML 物料清单 试图把 dataset→model→application、版本、许可和依赖转为可追踪图;但 source metadata 缺失或 gate 阻断会产生 unknown,而不是自动判定违规。模型文档债务 的存在是透明度问题,仍不等于风险已经发生。
尚不能证明实际伤害下降
截至本轮检索,没有找到模型 hub 层面对 gating、moderation 或 model-card 覆盖率的随机实验、严格 interrupted time series、difference-in-differences 或其他可信因果研究,也没有找到 card 完整度直接降低部署误用或伤害的证据。DocML 的 n=16 实验支持 notebook 提示改善短期文档行为,却不能推出真实系统更安全。政策存在、覆盖率、flag 数、scanner benchmark 和申诉推翻率都应与实际结果分开;系统研究由 模型市场治理效果评估 继续积累。
责任如何分配
这不是统一法律结论,而是由证据与可执行能力推导出的操作分工:
- 生产者/上传者:安全格式与构建、版本和 lineage、hash/签名、训练数据/基础模型/许可证披露、发布前评测和事件更新;
- 平台/市场:说明每个 scanner 与 badge 的对象、格式和失败语义;上传前扫描与隔离、访问控制、明确状态变化、申诉、model-level event log、紧急撤权/下架;
- 下游集成者/取得者:固定 revision、核验 hash/签名、sandbox 或 safe loader、独立测试、保留许可证和 AUP 链;不能把“未标红”当安全保证;
- 监管者/审计者/研究者:规定最小 machine-readable schema、抽样复核、incident taxonomy、研究者受控访问、跨平台/镜像协调,并把治理效果与活动量分开。
GPAI 分发链责任 的法律边界须逐案处理。EU AI Act Article 53 与 Annex XI/XII 要求 GPAI provider 提供技术文档、下游信息、版权政策、训练内容摘要及 release/distribution method;单纯托管第三方 repo 不能自动推出 hub 就是该模型 provider。EU GPAI Code of Practice、NIST SP 800-218A、NIST AI 600-1 与 NTIA 开放模型权重报告(2024) 提供风险管理框架,但都是合规路径或政策指导,不是平台已有效降低风险的认证。
如何测量治理效果
效果链至少分四层:制度存在 → 采用/覆盖 → 检测与执行质量 → 真实风险结果。
- 固定 snapshot、分母,明确 gated、deleted、fork、mirror 和不可访问对象如何处理;
- 分开测 card/tag 的存在、正确性、完整性与时效性;
- scanner 报告 TPR、FPR、校准、格式覆盖、evasion/OOD、扫描延迟,并把 unsafe、exploitable、malicious 分成不同标签;
- 记录 artifact 从 upload 到 block 的暴露时长、下载者、fork/mirror 传播,以及 confirmed execution、incident 与损失;
- 记录 gate 的 request→decision 时间、拒绝/撤销/申诉/恢复、false denial 和地区/机构差异;
- 优先随机或 stepped-wedge rollout;否则使用 interrupted time series、synthetic control 或 threshold RD,并预注册 estimand、检查同期政策和用户构成变化。
重开条件是平台公开可固定的 model-level moderation event logs、下载暴露、申诉和 scanner ground truth,或出现分阶段 rollout、独立 replication、跨平台自然实验与监管 incident/recall microdata。在此之前,最稳妥的结论不是“工具无效”,而是:已知工具确实运行、已知风险确实存在,但公开证据尚不足以估计其净效果。
审计清单
评估一个模型市场和具体 artifact 时,至少分别记录:
- 平台、政策版本、访问日和 immutable revision;
- repository visibility、gate/early access、审批主体与实际匿名/登录下载结果;
- card license、LICENSE、custom terms、AUP 和上游逐层许可;
- artifact hash、签名、格式、远程代码、依赖与 scanner 的对象/状态/错误语义;
- NFAA/Content Level、举报、人工复核、unrank/disable/remove/账号行动;
- 申诉、恢复、外部救济及决定时长;
- 已下载副本、缓存、fork、mirror、衍生物和真实召回能力;
- 把平台自报、独立 benchmark、事件个案和因果效果明确分级。
相关页面
- Hugging Face Content Policy
- Hugging Face Gated Repositories
- Hugging Face 模型安全扫描
- 2024 Hugging Face 恶意 Pickle 模型事件
- Civitai Content Levels
- Civitai Early Access
- Civitai 模型权限标签
- ModelScope 仓库内容治理
- GitHub Models 退役(2026-07-30)
- 模型供应链 Ecosystem Graphs
- AI/ML 物料清单
- 不安全模型反序列化
- 行为使用许可证
- 模型文档债务
- GPAI 分发链责任
- 模型市场治理效果评估
证据
- 原始资料快照(本地归档)
- Moderating Model Marketplaces
- MalHug
- PickleBall
- Hugging Face Content Policy
- Protect AI Scanner at Hugging Face: 6 Months In
- Hugging Face DSA Transparency Report 2025
- Civitai Terms and Safety Center
- ModelScope Hub client fixed revision
- GitHub Models retirement
- EU AI Act Article 53
- NIST SP 800-218A