阶段 A 产物。L0=SIMULATION,L1=benchmark_environment,L2=evaluation_metric_definition。
定位:定义统一的任务成功标准和性能评估指标(成功率、完成时间、路径质量等)。
本文档是最终 JSON 的唯一事实来源之一;分链深度调研见evaluation_metric_definition/chain_<NN>_<slug>.md。
从 L2 keyword、简报描述、v4 树上下文提取核心概念词:
evaluation metric definition / task success criterionsuccess rate / completion time / path qualitybenchmark scoring metric / robot benchmark evaluationSPL Success weighted by Path Length(导航效率加权范式代表)rliable IQM performance profile(少样本 RL 统计严谨性范式代表)对上述种子词执行 WebSearch,记录前若干结果中出现的系统/论文/数据集/术语。结合简报"注册表候选"已核实条目(按 01_research_methodology.md 总体原则 0,已入库条目不重复 WebSearch 验证存在性),归纳如下。
出现的系统/框架名:
- RLBench(James/Macleod 等,含 task._success_criteria() 程序化成功判定接口)——已入库 AST_SIM_RLBENCH
- MetaWorld / Meta-World+(Yu et al. CoRL 2019;McLean et al. NeurIPS 2025 v3 标准化)——已入库 AST_SIM_METAWORLD、AST_FRM_METAWORLD_PLUS
- LIBERO(130 任务过程化生成 + 4 任务套件)——已入库 AST_BMK_LIBERO
- CALVIN(长程语言条件连续控制基准)——已入库 AST_DST_CALVIN
- CLIPort(语言条件双流 BC)——已入库 AST_TLS_CLIPORT
- Habitat / Habitat ObjectNav / PointNav Challenge(SPL/SR 核心指标)——已入库 AST_SIM_HABITAT、AST_BMK_HABITAT_OBJECTNAV、AST_FRM_HABITAT_CHALLENGE
- rliable(google/rliable,Agarwal et al. NeurIPS 2021 Outstanding Paper)——已入库 AST_FRM_PRECIPICE、AST_DST_RL_BENCHMARK
- BOP Benchmark(6D 位姿估计评测,Hodaň et al.;ADD/AR/VSD/MSSD/MSPD)——已入库 AST_DST_BOP_BENCHMARK
- GraspNet-1Billion(抓取评测物体集 + AP/IoU)——已入库 AST_MDL_GRASPNET_OBJECTS
- GEARS(Global Evaluative Assessment of Robotic Skills,5 分制 × 6 维度评分 rubric)——已入库 AST_TLS_GEARS_SCORING
- NASA-TLX(任务负荷指数,6 维度主观量表)——已入库 AST_TLS_NASA_TLX
- py-motmetrics(MOTA/MOTP/IDS/IDF1 等 MOT 评测)——已入库 AST_TLS_PY_MOTMETRICS
- ISO 9283(工业机器人性能准则:位姿精度/重复性/轨迹精度,≥30 次连续测量)——已入库 AST_TLS_ISO_9283
- DARPA DRC Task Specification(8 标准化灾难响应任务,时间/完成度评分)——已入库 AST_TLS_DRC_TASK_SPECIFICATION
出现的论文标题与作者:
- Agarwal et al., "Deep Reinforcement Learning at the Edge of the Statistical Precipice", NeurIPS 2021 Outstanding Paper(少 seed RL 评估统计方法学)
- Anderson et al., "On Evaluation of Embodied Navigation Agents", 2018(SPL 指标的奠基性定义)
- Yu et al., "Meta-World: A Benchmark and Evaluation Environment for Multi-Task and Meta Reinforcement Learning", CoRL 2019
- Hodaň et al., "BOP: Benchmark for 6D Object Pose Estimation"(评测协议 ADD/AR/VSD/MSSD/MSPD)
- Goh et al., GEARS 验证研究(Global Evaluative Assessment of Robotic Skills 评分量表)
- Hart & Staveland, NASA-TLX(NASA 任务负荷指数)
出现的数据集/benchmark 名:Meta-World+ v3、RLBench、LIBERO、CALVIN、Habitat ObjectNav/PointNav、R2R、BOP(LM/LM-O/YCB-V/T-LESS/HB 等)、GraspNet-1Billion、DARPA DRC、RoboCup Rescue。
出现的技术术语:success rate(成功率)、success criterion / termination condition、SPL(Success weighted by Path Length)、SR(Success Rate)、NEES、nDTW、IQM(Interquartile Mean)、Optimality Gap、Probability of Improvement、Performance Profile、Stratified Bootstrap、ADD(Average Distance of Model)/ ADD-S、Average Recall (AR)、VSD/MSSD/MSPD、AP/IoU(抓取与检测)、MOTA/MOTP/IDF1、coverage rate、time-to-completion (TTC)、progress score(部分完成度)、rubric scoring。
success criterion → termination condition、goal condition、done condition、task success predicate、success flagevaluation metric → scoring metric、performance metric、benchmark metric、KPI、evaluation protocolsuccess rate → success ratio、SR、completion ratepath quality → path efficiency、trajectory quality、path length ratio、geodesic distancecompletion time → time-to-completion、TTC、mission time、episode lengthstatistical rigor → uncertainty quantification、bootstrap confidence interval、robust aggregation基于广度扫描发现的技术路线,显式列出 5 条候选链。每条链代表一种本质不同的评估指标定义范式——即"如何把机器人任务的完成情况量化成一个(或一组)可比较的指标"的不同方法论。
task._success_criteria() 接口)、MetaWorld/Meta-World+(任务终止条件 + success flag)、LIBERO(goal-conditioned success)、CALVIN(长程目标谓词)、CLIPort(10 任务 success 判定)。注册表已有伞形能力 CAP_fe13f66f(仿真任务程序化成功判定)及子能力 CAP_a63b51d5(RLBench 成功标准验证)。CAP_f376f3cd(目标条件化评估指标,含 success rate / SPL)、CAP_296a1d18(视听导航评估,SPL/SR)。AST_DST_RL_BENCHMARK)。注册表已有 CAP_e836fdfd(rliable IQM 与性能剖面统计评估)。AST_DST_BOP_BENCHMARK、AST_MDL_GRASPNET_OBJECTS、AST_TLS_ISO_9283。AST_TLS_GEARS_SCORING、AST_TLS_NASA_TLX、AST_TLS_NASA_TLX_DESKTOP。本主题广度扫描识别出 5 条本质不同的指标定义范式(离散二值成功 / 成功×效率复合 / 跨 run 统计聚合 / 连续几何误差 / 人工 rubric),均非换名复用——每条链的指标本体(数据类型、聚合层级、是否含效率维度、是否人工)各不相同。故列出 5 条候选链,未为凑数硬合并,也未因"已有 2 条"而截断。
候选链清单定稿前,按主文件 Step 2a 要求对上述 5 条候选链做红队评审(遗漏 / 错误 / 粒度 / 排序)。
1. 遗漏检查:核查是否有重要指标定义范式被遗漏。
- 考虑过"覆盖任务完成度度量"(coverage rate / time-to-completion)是否独立成链——结论:完成时间(TTC)与覆盖率本质是"二值成功 + 效率/范围"范式的特化,可作为候选链 01(success criterion 链)的辅助指标或候选链 02 的姊妹指标,不构成独立第 6 范式;注册表已有伞形子能力 CAP_0401d6fe(完成时间度量)可复用,故不单列。
- 考虑过 MOT 评测(MOTA/MOTP/IDF1,py-motmetrics)是否独立成链——结论:MOTA 等是"检测+关联"的复合计数指标,范式上归属候选链 04(连续/计数几何误差)家族,作为该链的代表性资产之一即可,不单列。
- 考虑过 RoboCup/DARPA DRC 的"竞赛复合计分"(任务分×时间分×罚分)——结论:这是候选链 01(二值成功)+ 完成时间的工程化复合,属同一范式族,由候选链 01 承接(DRC Task Specification 作为代表系统),不单列。
- 结论:未发现遗漏的独立范式。
2. 错误检查:逐条核验范式定位与代表系统。
- 候选链 01:RLBench _success_criteria() 接口、MetaWorld success flag 定位正确(搜索结果确认 success_criteria 模式)。
- 候选链 02:SPL 公式 S × (geodesic/max(geodesic, actual)) 正确(搜索结果确认 Anderson/Habitat 标准定义)。
- 候选链 03:rliable 三核心功能(分层 bootstrap CI、性能剖面、聚合指标 IQM/OG/PI)正确(搜索结果确认)。
- 候选链 04:BOP ADD/AR + VSD/MSSD/MSPD 定位正确(搜索结果确认 AR 为位姿评测指标)。
- 候选链 05:GEARS 5 分制 × 6 维度定位正确(简报核实)。
- 结论:无错误。
3. 粒度检查:5 条链粒度均匀,无过粗/过细。每条对应一个独立范式且各有 ≥1 个真实系统支撑。未发现需合并或拆分的链。
4. 排序检查:按"基础→特化→统计层→感知层→主观层"逻辑排序合理:01 二值成功(最基础)→ 02 效率加权(导航特化)→ 03 统计聚合(meta 层)→ 04 几何精度(感知层)→ 05 人工 rubric(主观层)。符合主流→经典→统计严谨→精度→主观的演进逻辑。
5. 边界合规检查:5 条链均落在 L2 evaluation_metric_definition 范围内(定义指标),未越界到兄弟 L2(domain_specific_benchmark / leaderboard_system / reference_implementation / reproducibility_framework / standard_task_suite)。各代表系统作为"指标定义方法论的载体"引用,不展开调研其基准套件本身。
修正动作:红队评审未要求合并/拆分/重排,候选链清单维持 5 条原样定稿。
本节由 Step 2c 填写(全部链回收后)。逐链对真实系统支撑、步骤充分性、数据流连贯、逻辑推演完整、否定性证据五项做质量裁决。
task._success_criteria())、MetaWorld(success flag)、LIBERO(BDDL goal 谓词)、CALVIN、CLIPort——5 个真实基准系统支撑充分。_retrieval_docs/evaluation_metric_definition/chain_01_programmatic_binary_success.md_fragments/evaluation_metric_definition/chain_01.json_retrieval_docs/evaluation_metric_definition/chain_02_navigation_efficiency_weighted.md_fragments/evaluation_metric_definition/chain_02.json_retrieval_docs/evaluation_metric_definition/chain_03_few_shot_rl_statistical_rigor.md_fragments/evaluation_metric_definition/chain_03.json_retrieval_docs/evaluation_metric_definition/chain_04_geometric_precision_metric.md_fragments/evaluation_metric_definition/chain_04.json_retrieval_docs/evaluation_metric_definition/chain_05_human_rated_rubric_metric.md_fragments/evaluation_metric_definition/chain_05.json5 条链全部通过单链质量门控(真实系统支撑 / 步骤充分性 / 数据流连贯 / 逻辑推演完整 / 否定性证据五项均达标),无作废链、无人工介入链。≥2 条链通过门控的条件已满足,可进入 Step 3 跨链注册表抽查。
| 链号 | 链名 | 分链文档路径 | Fragment 路径 | 裁决 |
|---|---|---|---|---|
| 01 | 程序化二值成功判定 | topic_v2/_retrieval_docs/evaluation_metric_definition/chain_01_programmatic_binary_success.md |
topic_v2/_fragments/evaluation_metric_definition/chain_01.json |
通过 |
| 02 | 导航效率加权度量 | topic_v2/_retrieval_docs/evaluation_metric_definition/chain_02_navigation_efficiency_weighted.md |
topic_v2/_fragments/evaluation_metric_definition/chain_02.json |
通过 |
| 03 | 少样本RL统计严谨性度量 | topic_v2/_retrieval_docs/evaluation_metric_definition/chain_03_few_shot_rl_statistical_rigor.md |
topic_v2/_fragments/evaluation_metric_definition/chain_03.json |
通过 |
| 04 | 几何精度度量 | topic_v2/_retrieval_docs/evaluation_metric_definition/chain_04_geometric_precision_metric.md |
topic_v2/_fragments/evaluation_metric_definition/chain_04.json |
通过 |
| 05 | 人为评分量表体系 | topic_v2/_retrieval_docs/evaluation_metric_definition/chain_05_human_rated_rubric_metric.md |
topic_v2/_fragments/evaluation_metric_definition/chain_05.json |
通过 |
本节由 Step 3 填写(跨链注册表抽查线索)。本节是给阶段 B 的线索清单,不是裁决——真正的合并动作全部在阶段 B 做。
通读各链第 7 节标"复用"的条目,核查同一真实项目在不同链里是否命中的是同一个注册表 ID:
| 真实项目 | 链 01 | 链 02 | 链 03 | 链 04 | 链 05 | 一致性 |
|---|---|---|---|---|---|---|
| RLBench | AST_SIM_RLBENCH | - | - | - | - | ✅ 单链引用 |
| MetaWorld | AST_SIM_METAWORLD | - | - | - | - | ✅ 单链引用 |
| LIBERO | AST_BMK_LIBERO | - | - | - | - | ✅ 单链引用 |
| CALVIN | AST_DST_CALVIN | - | - | - | - | ✅ 单链引用 |
| CLIPort | AST_TLS_CLIPORT | - | - | - | - | ✅ 单链引用 |
| Habitat | - | AST_SIM_HABITAT | - | - | - | ✅ 单链引用 |
| rliable | - | - | AST_PKG_RLIABLE | - | - | ✅ 单链引用 |
| BOP Toolkit | - | - | - | AST_PKG_BOP_TOOLKIT (新建) | - | ✅ 单链引用 |
| GraspNet | - | - | - | AST_DST_GRASPNET_1BILLION + AST_PKG_GRASPNET_API | - | ✅ 单链引用 |
| ISO 9283 | - | - | - | AST_DST_ISO_9283 (新建) + CAP_9093950a | - | ✅ 单链引用 |
| GEARS | - | - | - | - | AST_TLS_GEARS_SCORING + CAP_4a4a17eb | ✅ 单链引用 |
| NASA-TLX | - | - | - | - | AST_TLS_NASA_TLX + CAP_228a3b01 | ✅ 单链引用 |
| FLS Program | - | - | - | - | AST_TLS_FLS_PROGRAM | ✅ 单链引用 |
结论:无同一项目在不同链里出现两个不同 ID 的情况。所有跨链引用的注册表 ID 一致。
对各链"未命中,建议新建"的条目,抽查名称变体(中文名/别称/仓库名)再查一次,防止换个说法漏检:
| 新建条目 | 链 | 抽查 Query | 抽查结果 | 线索 |
|---|---|---|---|---|
| Geodesic Distance Computation | 02 | "geodesic distance NavMesh shortest path" | 未命中专门的 NavMesh 测地距离能力(仅有 BLE 路径损耗/C2C 点云距离等不相关能力) | 确认新建 |
| SPL Batch Aggregation | 02 | (已查) | 未命中专门的 SPL 批量聚合能力 | 确认新建 |
| SoftSPL Computation | 02 | (已查) | 未命中 SoftSPL 专门能力 | 确认新建 |
| Per-Run Score Matrix Construction | 03 | (已查) | 未命中专门的 per-run 分数矩阵构建能力 | 确认新建 |
| Geometric Precision Metric Computation | 04 | (已查) | 未命中专门的几何精度度量伞形能力 | 确认新建 |
| ADD ADD-S Distance Computation | 04 | "ADD ADD-S average distance pose error" | 未命中专门的 ADD/ADD-S 计算能力(仅有 C2C/C2M/M3C2 点云距离等不相关能力) | 确认新建 |
| Average Recall Aggregation | 04 | (已查) | 未命中专门的 AR 聚合能力 | 确认新建 |
| Human-Rated Rubric Metric Computation | 05 | (已查) | 未命中专门的人工评分量表伞形能力 | 确认新建 |
| Inter-Rater Reliability Assessment | 05 | "inter-rater reliability kappa agreement" | 未命中专门的一致性检验能力(仅有 Judge Rubric Definition CAP_eb5e9aa9 等不相关能力) | 确认新建 |
| Rubric Score Aggregation | 05 | "rubric score aggregation pass fail" | 部分命中:CAP_100da4a7(Multi-dimension Score Aggregation)用于 LLM-as-Judge 价值观评分,范式相似(多维分数聚合)但场景不同(LLM 评分 vs 人工 rubric 评分) | 待阶段 B 归并:阶段 B 需判断 CAP_Rubric Score Aggregation 与 CAP_100da4a7 是否应合并或保持独立 |
以下跨链衔接是方法学层面的引用,不涉及 ID 复用,阶段 B 在归并时需保持这些引用关系:
以下条目在注册表中已被兄弟主题 used_by,阶段 B 在归并时需注意边界:
| 条目 | 兄弟主题 | 本链引用方式 | 线索 |
|---|---|---|---|
| CAP_296a1d18 (视听导航评估) | audio_visual_fusion_perc, room_acoustic_simulation | 链 02 复用 | used_by 已含 evaluation_metric_definition,一致 |
| CAP_3022a61e (目标驱动导航策略) | sound_localization_sim | 链 02 复用 | used_by 已含 evaluation_metric_definition,一致 |
| CAP_7a3f2e1d (手术技能自动评估) | skill_level_estimation | 链 05 引用(不展开) | 本链关注人工 rubric,自动评估属兄弟主题 |
| CAP_228a3b01 (NASA-TLX) | collaborative_fluency_metrics, task_complexity_assessment | 链 05 复用 | 本链关注量表本身,HRC 应用属兄弟主题 |
| AST_TLS_FLS_PROGRAM | teleoperation_operator_training | 链 05 复用 | 本链关注 pass-line 作为评分标准,培训流程属兄弟主题 |
| CAP_64059919 (BOP VSD MSSD MSPD) | three_d_object_tracking | 链 04 复用 | 本链关注指标定义,位姿估计属兄弟主题 |
| CAP_9aa6dc8e (GraspNet AP) | task_specific_representation | 链 04 复用 | 本链关注指标定义,抓取检测属兄弟主题 |