跳转至

Physics 实验设置

Physics 阶段接收 Reconstruction 或数据集标注提供的参考动作。策略只能控制人体,物体关节没有电机, 必须由人体接触推动。

输入与任务

参考动作包含

\[ \widehat{\mathcal R} =\{\widehat H_t,\widehat T_t^o,\widehat q_t,\widehat s\}_{t=1}^{T}, \]

接触部位和接触时间可以是另行提供的 side input;它不是所有 baseline 都必须预测的输出。仿真中满足

\[ a_t=\pi_\theta(o_t),\qquad s_{t+1}=\operatorname{Sim}(s_t,a_t),\qquad \tau_{\rm object}^{\rm actuator}(t)=0. \]

也就是说,方法需要在跟随人体动作的同时,通过真实接触让物体关节完成目标运动,不能直接把参考关节角 写回仿真器。

两组正式实验

实验 输入 比较方法 对应表格
完整 Video-to-Physics D3D-HOI RGB → 固定的 Ours Recon CoDA、InterMimic、RePHO、Ours Table 2
绕过 Recon 的 Physics ARCTIC 标注;可选 ParaHome 标注 CoDA、InterMimic、RePHO、Ours Table 3

HDMI 只有按时完成接入后才加入。两组实验的数据不同,只在各自表格内部比较方法,不把 Table 2 和 Table 3 的数字相减来估计“重建误差”。

ARCTIC Physics-only 的输入路径

ARCTIC captured GT 直接绕过 Reconstruction。每个 backend 都先从同一条 captured GT source 取 ARCTIC-40 规定的 [start:end) 片段,再做自己的官方输入转换:

  1. CoDA 使用作者原生的 62-joint ARCTIC motion;
  2. InterMimic 与 RePHO 读取同一份官方 InterAct sequence,再转换为 OMOMO;
  3. HDMI 复用 OMOMO human input,再进入 Isaac Lab adapter;
  4. Ours 从同一份 InterAct sequence 直接准备 PHC input,不经过 OMOMO。

Studio 在这里负责选择 case、调用作者训练入口和记录 checkpoint provenance,不要求先写 result.pt,也不 要求 baseline 提供 Ours 专用的空间 contact_region。Object URDF、完整 joint trajectory、q0、active joint 与 两手 contact labels 都是同一 captured source 的 side input,不是第四种 human format;运行时也不从另一个 baseline 的目录读取这些 side input。

raw GT → clip → official preprocess → author train → checkpoint 只证明训练链可用,不能提前填论文结果表。

冻结的 ARCTIC case set

ARCTIC Physics-only 的正式 case set 已冻结为 ARCTIC-40。唯一的 dataset definition 是 configs/datasets/arctic40.json:10 个 articulated-object 类别,每类 4 条 subject-balanced use sequence, 共 40 条;不包括 scissors。它直接绕过 Reconstruction,用于 CoDA、InterMimic、RePHO 和 Ours 的相同 captured-reference 比较。不得再从全序列、旧的 experiment manifest 或方法结果重新挑选片段。

项目 已冻结的规定
参考来源与范围 ARCTIC captured GT human + articulated-object trajectory;Physics tracking only,Recon 不在本实验内
时间轴 30 Hz;所有区间均按 zero-based 半开区间 [start:end) 读取
初始化 每条均从 source raw frame 0 开始;不作 post-grasp reset
接触状态 使用 capture 的原始状态;没有筛成“frame 0 必然无 hand-object contact”的条件
片段长度 207–370 帧;不是为迎合某一方法而统一截成 300 帧
选择独立性 source 和片段边界不读取任何方法的训练、rollout 或结果
40 条如何得到片段 数量 冻结规则
有 Text2HOI 时序描述的类别 36 直接使用 InterAct compute_chunk_ranges 的切分;每条取最早一个完整包含至少一个已标注 openclose phase 的 chunk
espressomachine 4 Text2HOI 没有对应 description file;对 captured GT 的 object joint q 用 9-frame 平滑,在 200–400 帧内按显著局部极值选取最接近 300 帧的终点。四条都在所选片段内经历 q 增加和减小;这是运动学方向检查,不是伪造的文字标注

每个 case 的 source、[start:end)、选择来源和 phase coverage 都写在 JSON 内。36 条的切分依据是 Text2HOI description 与 InterAct 实现;4 条 espresso 的全部数值参数和状态到达帧也写在同一文件。执行时应由 各 backend 的 dataset reader 对原始 reference 做这个 slice,而不是改写 ARCTIC raw data 或把某一 backend 导出的格式交给另一 backend。

当前一条代表 case 的 10-epoch pipeline validation 已在 CoDA、InterMimic 和 RePHO 上全部通过;验证配置为 适应共享 GPU 降低了并行环境数。当前 budget calibration 已恢复 CoDA/InterMimic 的 4096 env 和 RePHO 的 1024 env × 2 workers。正式全 case 训练使用同样的作者环境数、minibatch 和训练器;epoch/checkpoint 预算由 visible candidate comparison 预先冻结,不能根据 private test 或哪一项阈值让 Ours 更好再修改。

所有方法保持一致的内容

  • 参考动作、物体模型、初始关节状态、接触标注和时间轴;
  • 重力、碰撞、摩擦、支撑面和控制频率;
  • 训练步数、模型选择规则和评测程序;
  • 每个 scheduled case×seed 一个逻辑环境、一次正式评测,不取 best-of-trials;
  • Crash、NaN、超时、缺少输出和提前终止都计为失败。

训练时可以使用方法原本的初始化分布,但人体、物体和关节状态必须来自同一个参考时刻。评测从统一的初始 状态开始,物体关节速度设为零。

比较方法见 Physics 比较方法,成功条件和其他指标见 Physics 评测指标,运行方法见 Physics Studio Guide