共同评测规则¶
Reconstruction 和 Physics 的方法对比都遵守本页规则。核心原则很简单:同一张表中的方法使用相同数据、 相同输入权限和相同评测程序;失败样本不能从统计中删除。
公平比较¶
| 必须相同 | 可以因方法而不同 |
|---|---|
| 样本、数据划分、物体模型和参考动作 | 网络结构和策略结构 |
| 初始关节状态、接触标注和时间轴 | Observation、action 和 reward 设计 |
| Physics 环境、训练步数和模型选择规则 | 方法原本使用的优化器和训练方式 |
| 评测程序、失败处理和统计方式 | 为接入统一接口所需的少量适配代码 |
如果适配过程改变了方法的核心算法,需要明确标为 adapted。方法原生代码的结果可以作为补充说明, 但不能和统一协议下的结果混在一起排名。
数据划分¶
| 数据 | 用途 |
|---|---|
| 开发集 | 调试代码、检查输入和估算运行时间 |
| 可见验证集 | 选择方法版本、阈值和最终实验配置 |
| 最终测试集 | 方法和指标确定后只运行一次,用于论文正式结果 |
如果团队在方法确定前查看了最终测试集的逐样本结果或视频,这部分数据就不能继续作为最终测试集。
每个样本如何计数¶
- 每个 scheduled case×seed 对应一个逻辑环境和一次正式评测;seed 集合在 manifest 中预先写明。
num_envs只表示同时运行多少个不同 case×seed,不增加重复数。- Crash、NaN、超时、缺少输出和提前终止都计为失败。
- 连续误差只在真实运行过的帧上计算,同时报告有效时长和有效帧比例。
- 不只统计成功样本,也不只统计两种方法都成功的交集。
因此,论文中的分母来自预先确定的样本清单,而不是运行结束后扫描到的结果文件。
统计方式¶
每个视频样本是一个统计样本,视频帧不是独立样本。主结果报告平均值或成功率、方法间差值和 95% 置信区间。 有多个 seed 时先在 case 内聚合,再跨 case 聚合。同一 CAD 或同一物体实例下的多个样本在 bootstrap 时 作为一组处理。Physics 的 revolute 误差用 rad,prismatic 误差用 m,二者分开报告;可附带 degree/cm 阅读换算。
消融实验同时比较多个组件时使用 Holm correction。类别结果和单个 CAD 的结果放在附录,不能只挑效果 最好的类别支持正文结论。
训练和模型选择¶
- Physics 方法使用相同的 environment-transition budget,不按 epoch 数强行对齐。
- 每种方法可以保留原来的训练器和优化器。
- 最终模型按照预先确定的规则选择,不能根据测试集表现挑选模型。
- 预训练数据、额外搜索次数、人工干预和 GPU 时间需要在附录说明。
每次实验需要保留什么¶
至少保存方法版本、输入数据、配置、训练预算、模型、评测结果、失败原因和可视化。记录应能回答: 运行了哪个方法、用了哪些样本、为什么失败、表格里的数字从哪里得到。
指标的具体计算方式见 Reconstruction 指标 和 Physics 指标。当前哪些实验已经完成见 Results,待办事项见 28 天实验计划。