能够与柜门、烤箱、抽屉等日常铰链物体进行全身交互,是 humanoid 进入真实环境的基本能力。然而,训练这类策略所需的高质量人-物交互轨迹依赖动捕、遥操作或逐任务人工设计,成本高、覆盖窄,难以扩展到大量物体、动作和人体风格。
从视频到物理可执行的铰链交互轨迹
Scalable Video-to-Physics Data for Articulated Human–Object Interaction
PARAGRAPH-BY-PARAGRAPH
Intro 应该怎样写
真实视频和视频生成模型提供了近乎无限的语义与动作多样性。现有 4D HOI 方法已经能够从视频恢复人体运动、物体位姿和关节状态,使“从像素自动构造交互数据”成为可能。但这些结果主要满足视觉重投影或运动学一致性,不能直接作为物理策略的训练轨迹。
铰链交互的困难不是轨迹看起来是否正确,而是运动能否由接触真实地产生。几厘米的手柄偏差、错误的接触时序或不一致的碰撞几何,都可能让手穿透、滑开,或无法对被动关节产生有效力矩。直接播放物体关节角会掩盖这个问题,也会把错误监督带给下游策略。
本文研究:给定生成或真实的单目交互视频及其可动对象资产,如何恢复并修正人体、物体根节点和内部关节的耦合轨迹,使人体通过物理接触驱动无 actuator 的物体关节,同时保持对视频的观测保真,并导出统一的 simulator-ready 训练数据。
系统先重建人体、物体、关节及候选接触,再在模拟器中用受控 humanoid 与被动铰链物体复现交互;物理修正只在接触相关的时空区域调整人体和物体参考,联合约束视觉一致性、接触稳定性、碰撞与关节任务进展,最后导出状态、动作、接触和资产元数据。
论文不能只证明 penetration 更低。最终结果必须证明三件事:视频到可用轨迹的转化率高;修正后的轨迹在被动物理下能够完成铰链任务;用这些轨迹训练的同一套下游策略,在未见物体或动作上优于使用原始重建轨迹训练的策略。
Intro 最后落到三条 Contribution
- 01
视频到物理数据管线
提出一条面向全身 articulated HOI 的自动数据管线,把生成或真实视频转换成包含人体、物体根状态、内部关节与接触信息的 simulator-ready 轨迹。
- 02
被动铰链物理修正
通过人体接触而非物体关节播放来恢复交互,并在观测保真与动力学可执行性之间优化耦合轨迹。Contact-to-actuation 只作为这一过程的诊断指标。
- 03
数据的下游价值
建立跨资产的铰链交互数据与评测,证明物理修正后的轨迹能提高下游策略的训练效率、任务成功率和未见物体泛化。
不要写:“第一个 video-to-physics / 第一个 physics-based HOI。”SUGAR、GRAIL 和 RePHO 已经覆盖宽泛表述。可以写的是本文聚焦的任务边界:从视频规模化构造由人体接触驱动的被动铰链交互轨迹,并检验其下游训练价值。
EXPERIMENTS · 从数据产出到下游收益
物理部分实验设计
不是“轨迹修得更平滑”,而是“同样的视频经过物理修正后,能产生更多可执行数据,并让同一个下游策略学得更好”。
3.1 四个研究问题
能否批量转化?
从输入视频到 reconstruction、sim-ready asset、物理成功轨迹的逐级 yield 与单位成本。
是否仍忠于视频?
人体、物体根状态、关节角和接触时序的观测误差,防止物理修正把动作改成另一个任务。
是否真的由接触完成?
物体关节无 actuator;报告任务成功、有效关节力矩、penetration、滑动和无接触运动。
是否让下游学得更好?
固定策略结构与训练预算,只改变训练轨迹来源,比较成功率、样本效率与未见资产泛化。
3.2 数据集与划分
| 集合 | 建议规模 | 用途 | 划分原则 |
|---|---|---|---|
| Debug set | 现有 20 cases | 实现、阈值和可视化;不能作为主结论 | 只用于开发,不进入最终 test |
| Real-video benchmark | D3D-HOI 全部可用 hinge cases;代码清单为 239 | 真实单目噪声下的转化率、保真度和物理成功 | 按 CAD identity 划分,未见资产只出现在 test |
| Generated-video corpus | 至少数百条,覆盖多个类别、资产、动作方向和速度 | 验证“视频生成可扩展为训练数据”的核心故事 | 同时保留未见资产、未见动作组合与未见类别 split |
| External set | RBO / HOI4D 中协议兼容的 articulated subset | 验证结论不依赖 D3D-HOI 和单一重建器 | 传感器或标注协议不同的结果单列 |
3.3 Baseline:分两层比较
Raw reconstruction
直接把视觉轨迹作为 reference;视觉上限、物理下限。
Kinematic cleanup
IK、平滑、penetration projection,但不做动力学优化。
InterMimic / PHC tracking
固定公开物理 tracker,测试原始 reference 能否直接被跟踪。
RePHO-style refinement
最接近的 per-sequence physics-guided reconstruction。
Ours without articulation-aware terms
同一优化器但只看人体/物体 tracking,隔离关节与接触建模的贡献。
Ours full
接触窗口、功能部件、被动关节与 observation budget 联合修正。
SUGAR 和 GRAIL 更适合做系统级 comparison:数据规模、任务覆盖、下游 policy 指标及输入特权程度。若代码和协议无法对齐,不应伪装成逐帧数值 baseline。
3.4 指标:主表不能只放几何误差
| 维度 | 核心指标 | 回答的问题 |
|---|---|---|
| Pipeline yield | 重建成功率、sim-ready 率、物理完成率、每条成功轨迹 GPU-hours | 数据管线是否真的可扩展 |
| Observation fidelity | 人体 MPJPE / acceleration error、物体 root error、joint-angle error、2D reprojection | 物理修正是否仍对应原视频 |
| Physical validity | penetration depth/volume、foot slip、contact slip、非接触物体运动、动力学残差 | 是否消除不可物理的伪影 |
| Articulation task | 关节目标完成率、normalized joint progress、time-to-completion、joint-axis effective torque | 接触是否真正驱动铰链 |
| Downstream utility | policy success、训练样本效率、未见资产/动作成功率、扰动鲁棒性 | 这些轨迹是否是更好的训练数据 |
| Diversity | 类别、资产、接触部件、关节范围、动作速度和人体运动覆盖 | 是否只是重复少量成功模板 |
3.5 最关键的下游实验
MAIN TABLE
固定同一个 InterMimic / ResMimic-style policy、网络、训练步数与随机种子,分别使用 Raw、Kinematic-cleaned、Physics-refined 和 Curated/GT 轨迹训练。按 25%、50%、100% 数据量绘制学习曲线,并在 seen asset、unseen asset、unseen action-composition 三个 test split 上评估。
| 训练数据 | Seen asset success | Unseen asset success | Unseen composition | 达到固定成功率所需样本 |
|---|---|---|---|---|
| Raw reconstruction | 待实验 | 待实验 | 待实验 | 待实验 |
| Kinematic cleanup | 待实验 | 待实验 | 待实验 | 待实验 |
| Physics-refined data | 核心结果 | 核心结果 | 核心结果 | 核心结果 |
| Curated / GT upper bound | 上限 | 上限 | 上限 | 上限 |
3.6 必做 Ablation 与可视化
Ablation
No physics;物体关节被直接播放;无功能部件接触;无 contact-window localization;无 observation constraint;只优化人体或只优化物体;不同视频生成规模。最重要的是比较“关节直接跟踪”与“关节完全被动”,排除作弊式成功。
Figure / Video
主图展示同一视频的 Raw → Reconstruction → Physics-refined → Downstream rollout;叠加接触点、关节轴和有效力矩。第二张图画 video count 对 sim-ready yield 与 downstream success 的 scaling curve;失败案例按重建、资产、接触和控制四类归因。
论文成立的最低条件:不只是 20 个 case 上物理指标改善,而是数百条 generated/real videos 的批量转化结果,加上一张固定下游策略的训练数据对照主表。没有下游收益时,story 只能退化成 physics refinement paper,不能写成 scalable data paper。