
该模型可将人类第一视角操作视频直接转化为结构化 3D 轨迹,并支持将轨迹迁移至灵巧手,从而大幅降低具身智能模仿学习的数据采集门槛。
技术层面,ACE-Ego-Hand 将视频扩散模型改造为确定性几何编码器,以单次前馈替代多步去噪,推理提速约 33 倍。
具身智能模仿学习长期面临数据采集成本高、效率低的行业瓶颈,传统方式依赖人工采集操作数据,难以支撑大规模模型训练。第一视角视频转 3D 轨迹的路线,为数据生产提供了更低门槛的方案。
对灵巧手研发企业而言,该模型意味着可通过普通第一视角视频批量生成训练轨迹,降低数据获取成本。
对具身智能产业而言,该模型已产出约 5000 小时训练数据,其开源有望推动行业数据共享,但实际效果仍需观察。
免责声明:本文内容与数据由观点根据公开信息整理,不构成投资建议,使用前请核实。