跳转至

DeVI:视频 reference 到 Physics 的准确边界

结论:DeVI 是最接近本项目「不完美 video reference → full-body physics」的一篇工作;它不是 articulated-object tracker,也不是当前可运行 baseline。 本页只记录论文与官方仓库已经证实的事实,并据此约束本项目的表述和实验。

方法事实

DeVI 的实际定义 对本项目的意义
输入 形式化方法使用初始 SMPL-X human、目标 3D object、tabletop scene 与 text prompt;从渲染首帧生成 synthetic video 证明 generated video 可成为 HOI planning/reference source;不是从 D3D/ARCTIC 输入直接 tracker
imitation target refined 3D SMPL-X human + visible object vertices 的 2D tracks + 2D motion 推断的 binary hand-contact label 直接相关的 hybrid visual reference;不能等同于 3D articulated state
object state global translation、orientation、velocity 与 object mesh rigid SE(3),没有 joint \(q\)、joint limit、active link 或 fixed-base appliance
control SMPL-X humanoid、PD target、PPO / Isaac Gym;reward 合并 3D human、2D object reprojection 与 contact 与 full-body physics imitation 同类;其 object term 可作为 visual-target ablation 的来源
评测 20 internet objects 的 generated examples;GRAB 上与 PhysHOI、SkillMimic、InterMimic 比较 GRAB rigid HOI 的结果不能填入本项目 articulated table;且其 baseline 数字只在双方成功的场景上比较
可复现状态 论文为 arXiv v1(2026-04-22);官方 repository 仅有 README/assets,声明代码仍在整理 记为 reported-only;不自制一个版本后称作官方 DeVI reproduction

主要来源:论文全文项目页官方 repositoryGRAB 官方代码页(状态核对:2026-07-27)。

为什么它与本项目强相关

DeVI 正面处理了本项目也会遇到的两件事:video 中的 object cue 不能可靠 lift 成精确 3D pose,且独立恢复的人体/手部与物体常有 HOI misalignment。它用 visual HOI alignment 修正 human reference,再以 object-point 的 2D reprojection reward 和 pseudo contact 将这些不确定 cue 交给 RL 消化。

这使下面的论断不成立:

  • “首次从 video/synthetic video 学 full-body physics HOI”;
  • “必须先有精确 3D object trajectory 才能做 physics tracking”。

壶盖与「可转动水壶」演示的核对

项目页的文字是 “lifts a pot lid ... places it onto the pot to close it”。该 lid 演示中, pot 与 lid 在第一帧已是两个分离物体;人拿起 lid,再将它放回 pot。它展示的是多刚体场景中的 语义 interaction,不是一个带 hinge 的 pot/lid asset。GRAB quantitative 媒体中的 waterbottle 序列则是单一物体的刚体 rotation;GRAB 的官方描述也将每个对象列为 “3D rigid object mesh (posed)”。因此视觉上的旋转、开合或放置不等于 articulated joint。

论文的 formal state 更具决定性:object 只由 global orientation 与 translation 表示,2D target 是该 object mesh vertices 的 image tracks。若作者实际使用了某个 hidden joint, 论文中必须有 joint state、link transform 或对应 simulation contract;目前公开论文、项目页和 repository 都没有这些定义。

为什么它不覆盖当前任务

本项目必须在同一 policy rollout 中满足

\[ q_0 \leftarrow \text{case JSON},\qquad q_t^{\rm sim}\ \text{仅由 human--object contact 驱动}, \]

并以 noisy \(\widehat q_t\)、moving-link state 和 region-level contact 评估。DeVI 的论文将 object 表示为全局 rigid pose,并选择用 2D tracks 避免 6D object pose;因此没有定义上述任一 articulation contract。把它直接扩展成「DeVI-articulated」会额外发明 joint observation、reset、reward、asset dynamics 与 evaluation,不能称为复现。

落到实验的最小动作

决定 做法
文献与主张 在 Related Work 中与 CoDA/HDMI 并列说明;论文 claim 排除 first video-to-physics
当前 baseline reported-only,不建 fork、不写 adapter、不排训练、不进入 matched ranking
可检验的启发 若最终机制需要视觉 target,再在 Physics Ablations 中登记具名实验:固定 camera,以 moving-link 2D tracks 比较纯 3D、纯 2D 与 hybrid target
未来代码发布后 先原生跑通 rigid DeVI;再将任何 articulated 修改明确命名为 DeVI-style articulated adaptation,并单独披露新增设计,绝不写作 official reproduction

这个设计让我们能测试 DeVI 最有价值的科学假设——2D visual object target 是否提升 noisy-reference robustness——同时不伪造它未定义的 articulated 能力。