Ego4D

Ego4D 是面向大规模第一视角人类活动理解的数据集与 benchmark。它为机器人学习提供视觉、语言、时序和人手交互先验,但没有原生机器人动作、力、奖励或控制轨迹。

发布与规模

对机器人学习的作用

R3M 的外部证据与复现边界

访问与许可

边界

相关页面

证据

VITRA 派生使用与 benchmark 去污染边界(2026-08-10)

VITRA 当前公开 metadata 中有 948,683 个 Ego4D-derived episodes,其中 cooking/cleaning 454,244、other 494,439。它用自动重建的 camera pose、depth、MANO hand action 和语言标注,不使用 Ego4D 原始 action annotations;但“未使用原标注”不等于没有视觉内容重叠。

VITRA 的代码和 metadata 标为 MIT,原始 Ego4D 视频并未随之再分发,使用者仍需单独签署 Ego4D 协议。衍生标注许可不能反向授权原视频。当前未找到 VITRA 对 Ego4D challenge test UIDs 的排除清单或 decontamination report,因此不能断言已经发生 benchmark leakage,也不能声称已排除;未来若用 VITRA 预训练模型评测 Ego4D benchmark,应把 released video_name/UID 与 licensed split manifests 对照。

Ego2Robot 又使用 249h VITRA 子集,但未公开这部分的 source UID composition。其 18,561 synthetic morphology-hours 因而不能作为与 Ego4D 完全独立的新经验量。

证据:原始资料快照(本地归档)