大旗号
科技 汽车 财经 数码 时尚 旅游 美文 美食 其它

三维手形重建模型重大升级!大晓机器人ACE-Ego-Hand首创实现双手 3D 手形重建

TMT星球 2026-09-02

近日,大晓机器人联合香港中文大学多媒体实验室、南洋理工大学等机构,开源了面向第一视角视频的 3D 双手形状重建模型 ACE-Ego-Hand,并已产出约5000小时训练数据。

ACE-Ego-Hand 可用于从海量第一视角视频中高效提取结构化的双手三维操作轨迹,将人类真实的抓取、装配和双手协同经验转化为机器人可学习的大规模数据,成为具身大模型训练数据的重要组成基座;并首次将视频生成模型作为DreamHand编码器,实现端到端训练,只需对整段视频进行一次分析,就能直接输出双手的姿态、形状和 3D 位置。

与此前依赖逐帧检测、窗口式时序回归或多步骤扩散采样的手部模型相比,ACE-Ego-Hand 将视频扩散模型改造成几何编码器,单次前馈恢复连续的双手 3D 轨迹:降低了推理延迟和误差累积,使模型能够利用完整视频片段中的上下文信息恢复被遮挡或暂时离开视野的手形轨迹。


对于产业而言,ACE-Ego-Hand 的价值不只是提升单帧手部姿态识别精度,而是将第一视角视频转化为连续、稳定且具有度量尺度的双手 3D 轨迹。它可以服务于产线操作数据采集、机器人示教、人工装配过程分析、灵巧手动作重定向和模仿学习数据构建等场景。尤其是在手部经常被工件遮挡、暂时离开画面以及相机快速运动的真实环境中,模型能够减少轨迹中断和手部丢失,为机器人从人类操作视频中学习完整动作过程提供数据基础。

从公开评测结果看,ACE-Ego-Hand 在 ARCTIC、HOT3D、HOI4D、H2O 和 OakInk2 五个第一视角手部基准上取得领先表现,在论文报告的 48 项主要指标比较中赢得 45 项。在遮挡严重的 ARCTIC 数据集上,模型相较 ViDiHand 将 MPJPE-p 降低约 30%;在复杂第一视角和广角场景下的 HOT3D 数据集上,MPJPE-p 降低约 40%;当评测纳入完全离开视野的手部后,性能优势进一步达到 45.9%-61.1%。在速度方面,ACE-Ego-Hand 在单张 A100 GPU 上达到约 63.1 fps,约为 ViDiHand 高精度配置的 33 倍。

不再反复去噪,手部 3D 恢复提速 33 倍


ACE-Ego-Hand 首先解决的是手部 3D 恢复过程中的效率问题。传统视频扩散模型通常需要经过多步去噪采样,逐步生成中间视频或像素结果,再从生成结果中估计手部姿态。这种流程不仅计算成本高,也会增加生成误差向后续姿态估计传播的风险。

ACE-Ego-Hand 去掉了这一多步骤去噪过程,不再将视频扩散模型作为像素空间的生成器使用,而是将其改造成确定性的几何编码器。输入视频经过 VAE 压缩后,模型直接在干净潜变量上进行一次前向传播,并从视频扩散 Transformer 的中间层读取时空特征。随后,这些特征被直接送入双向时空解码器,由模型端到端地输出双手姿态、形状、可见性和 3D 空间位置。

这种设计将原本“多步去噪生成视频,再进行手部估计”的流程,压缩为“单次前馈传播,直接恢复手部 3D 运动”。模型不需要反复生成 RGB 视频,也不依赖外部手部检测器和额外的逐帧裁剪,从而显著减少了推理环节和计算开销。

在单张 A100 GPU 上,ACE-Ego-Hand 达到约 63.1 fps,约为 ViDiHand 高精度配置下的 33 倍效率,为大规模处理产线第一视角操作视频提供了效率基础。

告别手形遮挡帧丢失,利用视频上下文补全离屏轨迹


ACE-Ego-Hand 另一核心创新是在手部被遮挡或离开视野后,推理恢复其运动轨迹。

这一能力来自模型的双向时空推理机制。传统因果模型主要根据过去帧预测当前结果,手部离开画面后只能进行单向外推,容易产生漂移。ACE-Ego-Hand 则对整段视频进行联合分析,不使用因果掩码,因此处理某个时刻时,可以同时利用手部消失前和重新出现后的信息。

手部消失前的画面能够提供运动起点、速度和方向,手部重新出现后的画面则提供运动终点和姿态约束。模型通过前后两侧的信息共同推断中间的不可见区间,从而保持手部身份和轨迹连续。

为了避免遮挡期间出现手部尺度变化,ACE-Ego-Hand 还引入片段级形状先验。同一只手在一个视频片段内只预测一次形状参数,而不是每帧单独估计。这样可以减少手部尺寸闪烁、形状漂移以及重新出现时的身份不一致。

这一设计对于产线操作尤其重要。实际操作中,手部被工件遮挡并不是偶发情况,而是装配、抓取和工具使用过程中的常见状态。对于机器人学习来说,完整的连续轨迹通常比若干张孤立的高质量单帧结果更有价值,因为机器人需要学习的是动作过程,而不是单个姿态。

在离屏手部评测中,ACE-Ego-Hand 在 ARCTIC 和 HOT3D 上相较 ViDiHand 的综合误差分别降低 45.9% 和 61.1%,说明其优势不仅体现在可见帧的姿态估计,也体现在对不可见运动过程的恢复能力上。

摆脱固定相机标定:利用头部第一视角恢复手部 3D 位置

ACE-Ego-Hand 的另一项关键能力,是在测试阶段无需显式输入相机内参,仅通过头戴式第一视角视频,即可恢复手部在相机坐标系下的度量 3D 位置。此外,ACE-Ego-Hand支持原生鱼眼超广角输入,面对鱼眼图像显著的径向畸变,模型无需提前标定相机、做图像去畸变,直接从畸变画面预测像素到三维空间的观测射线,完成手部度量 3D 位置恢复。模型不仅判断“手在画面中的哪里”,还进一步估计“手距离相机多远”,实现从二维定位到度量 3D 运动恢复的扩展。

ACE-Ego-Hand 根据视频特征,估计画面中不同位置对应的 3D 观察方向,相当于为图像中的每个区域建立一组“通往真实空间的射线”。随后,模型结合二维关节位置、手部自身的 3D 结构、深度信息以及多个关节之间的透视关系,通过基于射线的相机求解器和混合 PnP 几何计算,恢复手部在相机坐标系中的真实平移位置。

在此基础上,ACE-Ego-Hand 提供了 K-free 配置。在这一配置中,模型可以直接利用自身预测的视线场完成手部空间位置求解,从而降低对固定相机标定信息的依赖。这对于使用不同头戴式设备、不同镜头和不同采集工位的场景具有实际意义,也为跨设备部署提供了更大的灵活性。

这项能力意味着手部模型不必完全绑定在某一台固定相机或某一套标定参数上,可以更灵活地适应人员移动、头部转动和采集视角变化。模型输出的不只是手部在画面中的二维位置,而是可进一步用于机器人示教、轨迹重定向和模仿学习的 3D 手部运动数据。

五个基准测试SOTA,45项能力领先

DreamHand 在五个第一视角手部基准上进行了评测,覆盖双手遮挡、复杂相机运动、手物交互和长时序操作等场景。在的 48 项主要指标比较中,ACE-Ego-Hand 赢得 45 项,整体表现领先现有方法。其中,在 ARCTIC、HOT3D 和 HOI4D 上重点超过 ViDiHand;在 H2O 和 OakInk2 上,也在多数姿态、定位和轨迹稳定性指标上超过此前最佳方法。


在用于评估复杂双手操作和物体遮挡下的手部恢复能力的基准ARCTIC上,ACE-Ego-Hand 的 F1 达到 1.000,MPJPE-p(重建误差) 为 15.256 mm,并在主要姿态、空间位置和轨迹稳定性指标上超过其他基线。

在重点评估复杂第一视角和广角相机条件下的手部、物体 3D 跟踪能力的基准HOT3D上,ACE-Ego-Hand 的 MPJPE-p 为 12.888 mm,相比 ViDiHand 的 21.514 mm 降低约 40%。在包含离屏手部、二维定位、全局方向和相机平移的评测中,ACE-Ego-Hand 的指标全面领先。

在主要用于评估不同物体类别和操作行为下的人-物交互理解能力的基准HOI4D。ACE-Ego-Hand 在姿态精度、二维定位、空间平移和时间稳定性等核心 3D 恢复指标上明显领先。

主要研究第一视角下双手与物体交互时的姿态估计的基准H2O上,ACE-Ego-Hand 的 MPJPE-p 为 9.223 mm,明显优于此前表现最好的 Dyn-HaMR(17.213 mm)。在二维定位、全局方向和轨迹平滑性方面,DreamHand 同样超过多数基线。

主要关注复杂任务完成过程中的双手协同操作和长时域动作的基准OakInk 2,ACE-Ego-Hand 的 MPJPE-p 为 8.988 mm,明显优于此前最佳的 WiLoR(26.520 mm),误差降低约 66%;在二维定位、全局方向、相机平移和轨迹平滑性等指标上,ACE-Ego-Hand 同样取得领先。

ACE-Ego-Hand 打通产线数据到机器人执行链路

在产业落地上,ACE-Ego-Hand 实现了从第一视角视频到真实 Inspire 灵巧手动作迁移的完整流程。模型首先从头戴式相机拍摄的视频中恢复连续的双手 3D 关节轨迹,再将手指弯曲、关节运动和双手协同关系映射到机器人灵巧手,使机器人能够复现视频中的双手操作动作。通过这一流程,人的实际操作可以被转化为机器人能够理解和执行的动作数据。

ACE-Ego-Hand 最大的产业价值,是降低机器人操作数据的采集门槛。企业可以通过头戴式相机记录真实产线操作,再将视频批量转换为机器人可用的 3D 动作数据,用于机器人示教和灵巧手模仿学习。这为未来训练具身大模型提供了更具规模的数据来源:将大量真实的人类操作视频转化为连续、结构化的双手运动数据,让具身模型能够学习更多任务、工具使用方式和双手协同技能,加快从人类操作经验到机器人能力的转化。

聚焦AI材料研发,鼎犀智创完成数亿元Pre-A轮融资
9月2日,据报道,AI新材料研发公司鼎犀智创近日完成数亿元Pre-A轮融资。本轮融资由鼎晖百孚领投,九合创投、彬复资本、龙芯创投、顺禧基金、中关村资本跟投。此前鼎犀智创已获得昆仲资本、元生创投、上海未来产业基金、晶泰科技等机构投资,这是鼎犀智创一年

2026-09-02

追觅旗下户外庭院IFA 2026前瞻:自研激光雷达、具身机器人首秀
距离德国柏林国际消费电子展(IFA 2026)开幕仅剩2天,追觅旗下户外庭院板块将携全新产品阵容与全球化布局亮相,于柏林会展中心Hall 7.1a-b及Hall 9-127双展台联动展出,旗下DREAME、MOVA、NexLawn三大户外庭院品牌将集结登场,集中呈现其在AI与广义机器人领

2026-09-02

告别 “装宽带踩坑”—— 河南三大运营商宽带横评,只说真话
导语在河南租过房子的人,大概都经历过同一个场景:房东扔过来一张纸条,上面写着 “宽带已装,XX 运营商,续费找 XXX”。你连选的权利都没有。但如果你恰好是那个可以自己决定装哪家宽带的租房人 —— 那么恭喜你,你面临的是一个比挑房子还纠结的问题。中国

2026-09-02

IFA 2026前瞻: 追觅智能出行板块滑板车业务拿什么走向全球市场?
一场全球消费电子展,正在越来越像一场技术能力的集中考试。9月4日至8日,IFA 2026将在德国柏林举行。追觅旗下智能出行板块滑板车业务(以下简称“滑板车业务”)也将再次登陆IFA,并于9月4日举行“Beyond the Move”全球新品发布会。据了解,滑板车业务此次

2026-09-02

百川智能引入董璐加盟合伙人,负责公司市场及投融资
据媒体报道,从业内人士获悉,百川智能近日又有一新合伙人入职,前搜狗集团市场负责人董璐加盟,负责公司市场及投融资相关工作。据了解,董璐曾在搜狗与王小川共事近七年,双方有较长时间的工作协同和信任基础。根据消息透露,董璐此次在百川承担的不仅是市场

2026-09-02

阿里云企业级Agent协作平台万有无界开启公测
9月2日,阿里云旗下企业级人与Agent协作平台“万有无界”开启公测。企业用户和个人用户均可通过官网(https://www.qianwenai.com/agents/wanyou)注册体验,可调用阿里最新旗舰模型Qwen3.8-Max。万有无界是一个多角色Agent协作工作台。与让单一AI Agent大包大

2026-09-02

2026GEO赛道格局已定,主流服务商梯队划分与深度研判
2026年是GEO(生成式引擎优化)行业规模化落地、格局固化的关键元年。随着DeepSeek、豆包、元宝等主流大模型全面商业化,AI搜索、智能问答、品牌决策场景彻底普及,GEO从早期的概念营销、试水布局,正式进入标准化、商业化、规模化发展阶段。行业入局者持续增

2026-09-01