以人为中心的具身模型范式
以人为中心的具身模型范式
human-centric 具身模型范式把“人”从环境背景变量推进为机器人需要建模的交互主体。它是一组正在形成的研究与产品问题:具身智能的瓶颈不只是模型或硬件,也包括能否获得真实、连续、带有授权和明确标签的人类行为及反馈数据。这里的“范式”是方向性概括,不表示学界已经形成统一定义或公认代际。
观察
- 当前很多具身模型训练中“人”被弱化,模型识别物体和场景,却未必理解人类状态、意图、记忆和偏好。
- 第一视角数据被视为有价值,因为它天然包含感知、动作、环境反馈之间的闭环。
- 端到端和模块化不应被视为简单二分;复杂场景需要在系统不同层次引入语义表达和可解释性。
- 真实用户反馈被提出为评测具身智能的重要标准,因为标准化 benchmark 难以覆盖长期家庭场景。
- 数据来源包括互联网视频重建、低成本真实采集、真实用户部署反馈和高质量合成数据。
Human Model 提案与证据边界
- MindSpace 创始人在 2026-08-04 的私聊中把 Human Model(人类模型)提出为 LLM、World Model 之外的“第三条基础方向”,并设想同步记录第一视角视觉、脑电/肌电/心电等神经生理信号和行动选择。这应记录为 MindSpace 的产品/研究框架,而不是公认学术分类、已确立的新模型代际或已验证产品能力。
- 多模态同步可以支持时间对齐、模态消融和行为预测,但同步观察本身不等于读取意图、动机或心理状态,也不能识别“感知→神经表征→意图→行动”的因果链。因果与意图主张需要明确标签、跨被试/场景外推、伪同步对照、校准/拒答和随机化干预。
- EgoBrain 提供的是更窄的相邻证据:61 小时、40 名参与者、29 类受控日常动作的第一视角视频与 32 通道 EEG 动作分类,官方数据页另含 IMU;它没有 EMG 或 ECG。论文中的融合增益不能外推为潜在意图读取、神经中介识别或真实机器人闭环。
- Mental World Modeling、InteRACT 和 Machine Theory of Mind 等工作说明“建模人的心理状态或动作响应”已有相邻研究,但其验证分别受限于人工故事、小规模交互数据或 gridworld agent,尚不足以把 Human Model 宣布为成熟统一范式。
从第一视角观察到可执行控制
- 第一视角数据的价值需要按层次写:Ego4D 可提供视觉/价值先验,Ego-Exo4D 可支持三维手轨迹与技能分解,EgoMimic 和 Universal Manipulation Interface 再把人类示范映射到 pose 或末端轨迹。
- 当前公开成功路线仍需目标机器人示范、运动学约束或本体专属控制头。人类观察数据并不直接等于机器人 action,也不能因为同步了 gaze、EEG 或其他人体信号就跳过 embodiment 对齐。
- 部署后的人工纠正是另一类人本数据:它记录机器人何时需要人接管,而不是从视频推断人的潜在意图。
关联
- 以人为中心的具身智能:这是该方向的核心观察入口。
- 具身智能数据基础设施:它补充了“数据本身不对”和“真实用户反馈形成闭环”的观点。
- 世界模型:物理世界行动及其后果理解是世界模型能力的一部分。
- MindSpace:Human Model 是其产品/研究草案中的命名和能力设想,不能与本页方向性概括视为同一已验证对象。
- 人体模型:偏人的身体状态与动作学习;与 Human Model 有交叉,但不是同义名称。
- 清华具身智能创业生态:冯瑶、刘淼与清华人工智能学院相关,构成同批清华创业线索的一部分。
证据
raw/2026-08-07-luyao-b001-05-独家|两位清华教授联手创业,要打造以人为中心的具身模型范式-6c05e3a3.md
- 原始资料快照(本地归档)
- 原始资料快照(本地归档)