← 返回图谱

分链调研 05 · 人为评分量表体系

Human-Rated Rubric Metric(GEARS / NASA-TLX)

原件直出,未做删改或美化 —— 这就是 Agent 实际读到 / 实际写出的文件。 文末「12. 检索日志」一节即取证台账:每条 WebSearch/WebFetch 都登记了 query、命中数与用在正文第几节。 快照于 2026-07-25 18:21 冻结(32.6 KB · sha256 b72edf5b),此后源文件的改动不会影响本页。

evaluation_metric_definition 分链调研:链 05 人为评分量表体系

范式定位:由经过训练的人工评分员按标准化多维 rubric 对机器人/操作者技能执行做序数评分(如 GEARS 5 分制 × 6 维度、NASA-TLX 6 维度 × 0-100 分制 + 15 对两两比较加权),用于无法完全自动量化的技能质量与认知负荷评估。这是主观/人工评分范式,与前四链的客观自动计算正交。
状态:✅ 建议保留

1. 真实系统定位

本链对应的真实工程系统是三套人工评分量表:GEARS(机器人手术技能全局评估)、NASA-TLX(NASA 任务负荷指数)、OSATS(客观结构化技术技能评估)。三者都由人工评分员按标准化 rubric 做序数评分,但分别面向技能质量、认知负荷和通用外科技术。

1.1 GEARS(Global Evaluative Assessment of Robotic Skills)

1.2 NASA-TLX(NASA Task Load Index)

1.3 OSATS(Objective Structured Assessment of Technical Skills)

1.4 JIGSAWS 数据集(JHU Intuitive Surgical Gesture and Skill Assessment Working Set)

2. 步骤设计与模块映射

本链的工程步骤序列(从 rubric 加载到分数聚合):

步骤 工程动作 真实系统模块映射 证据 URL
s1_1 Rubric Definition & Dimension Loading GEARS 6 维度 rubric 加载;NASA-TLX 6 维度量表加载;OSATS 全局评分量表加载 https://nasa-tlx.firebaseapp.com/
s1_2 Task Performance Recording da Vinci 手术系统记录运动学轨迹 + 内窥镜视频(JIGSAWS 数据格式);遥操作任务记录操作日志 https://nasa-tlx.firebaseapp.com/
s1_3 Rater Training & Calibration 评分员培训:学习 rubric 维度定义 + 锚定参考评分 + 校准练习 GEARS/OSATS 评分员培训规程
s2_1 Multi-Dimensional Rating GEARS 6 维度 × 1-5 评分;NASA-TLX 6 维度 × 0-100 评分 https://nasa-tlx.firebaseapp.com/
s2_2 Pairwise Comparison Weighting (NASA-TLX) NASA-TLX 15 对两两比较 → 权重 w_i → WWL = Σ(w_i × r_i) / 15 https://nasa-tlx.firebaseapp.com/
s2_3 Inter-Rater Reliability Check Cohen's κ / Fleiss' κ / ICC 评分员间一致性检验,κ > 0.7 注册表 CAP_4a4a17eb 约束
s2_4 Score Aggregation & Pass/Fail Judgment GEARS 6 维度均值 → 总分 → 与 FLS pass-line 对照(≥75%);NASA-TLX WWL ∈ [0,100] 注册表 AST_TLS_FLS_PROGRAM

3. 数据流与分支结构

3.1 数据流表

步骤 输入 输出 外部依赖
s1_1 评分量表类型(GEARS/NASA-TLX/OSATS) rubric 配置(维度定义 + 分制 + 评分锚点) 量表定义文件
s1_2 任务执行 运动学轨迹 + 视频 + 操作日志 录制设备/仿真器
s1_3 rubric 配置 + 参考评分样本 校准后的评分员 评分员培训材料
s2_1 任务执行记录 + rubric 配置 6 维度原始评分 r_i 人工评分员
s2_2 NASA-TLX 6 维评分 + 15 对比较 WWL ∈ [0,100] + 各维度加权分 无(纯计算)
s2_3 多评分员的评分矩阵 κ / ICC 一致性指标 无(纯计算)
s2_4 聚合评分 + pass-line 总分 + 通过/未通过判定 无(纯计算)

3.2 分支结构清单

# 判断节点ID 判断条件描述 分支路径a 分支路径b 合并节点ID 证据URL
1 s2_2 判断量表类型是否为 NASA-TLX(需两两比较加权)vs GEARS/OSATS(直接均值) s2_2a: NASA-TLX→15 对两两比较加权求 WWL,condition: "scale_type == NASA-TLX" s2_2b: GEARS/OSATS→6 维度直接均值,condition: "scale_type == GEARS or scale_type == OSATS" s2_3(is_merge: true) https://nasa-tlx.firebaseapp.com/
2 s2_3 判断评分员间一致性是否达标(Cohen's κ > 0.7) s2_3a: κ > 0.7→接受评分,进入聚合,condition: "kappa > 0.7" s2_3b: κ ≤ 0.7→重新培训评分员/重新评分,condition: "kappa <= 0.7" s2_4(is_merge: true) 注册表 CAP_4a4a17eb

4. 逻辑推演五问

(a) 存在性论证

人为评分量表体系是机器人/操作者技能质量与认知负荷评估的主流范式。它解决的核心问题是:任务级自动指标(链01-04)无法刻画"技能执行质量的主观维度"——深度感知、双手协调、力敏感度、认知负荷等维度无法用程序化谓词或几何误差自动量化。GEARS(Gohil et al. 2012)用 5 分制 × 6 维度评估机器人手术技能;NASA-TLX(Hart & Staveland 1988)用 6 维度 + 15 对两两比较评估认知负荷;OSATS(Martin et al. 1997)用全局评分量表评估外科技术技能。三者都是人工多维 rubric 序数评分,是"人觉得做得怎么样"的主观判定。

(b) 步骤必要性论证

7 个步骤缺一不可:
- s1_1(rubric 加载):没有评分维度定义无法评分
- s1_2(任务执行记录):没有待评估的执行记录无法评分
- s1_3(评分员培训与校准):未经培训的评分员一致性低,κ 不达标
- s2_1(多维度评分):多维 rubric 评分是本链的核心动作
- s2_2(两两比较加权):NASA-TLX 的 15 对比较是 WWL 加权的关键步骤(GEARS/OSATS 跳过此步直接均值)
- s2_3(评分员间一致性检验):不检验 κ 无法保证评分可靠性
- s2_4(分数聚合与通过判定):单维度分数无统计意义,需聚合 + pass-line 判定

(c) 顺序因果论证

顺序严格因果:rubric 加载→任务执行记录(待评估内容)→评分员培训(为评分做准备)→多维度评分(核心评分动作)→两两比较加权(NASA-TLX 特有的加权步骤)→评分员间一致性检验(评分后验证可靠性)→分数聚合(最终输出)。s2_1 是所有评分的起点,s2_2 仅 NASA-TLX 需要而 GEARS/OSATS 跳过(分支),s2_3 对所有量表都需要,s2_4 最终聚合。

(d) 数据流完整性论证

从入口(量表类型 + 任务执行记录)到出口(总分 + 通过/未通过),数据流为:量表类型→rubric 配置→任务执行记录→校准评分员→6 维原始评分→加权 WWL(NASA-TLX)或直接均值(GEARS/OSATS)→一致性检验→聚合总分。无"魔法步骤"——每步输入都来自上一步输出或外部评分员。关键数据耦合:s2_1 的 6 维评分在 s2_2 加权(NASA-TLX)或直接传递(GEARS/OSATS),在 s2_3 做一致性检验,在 s2_4 聚合。

(e) 链间独立性论证

本链指标本体是人工多维 rubric 序数评分(主观、多维),与其他链的本质区别:
- vs 链01(程序化二值成功):链01是仿真器自动二值判定(0/1),本链是人工多维序数评分(1-5/0-100),含主观维度
- vs 链02(导航效率加权):链02是仿真器自动计算 SPL(成功×效率),本链是人工主观评分
- vs 链03(统计严谨性):链03是 run 分数层面的统计聚合,本链是单次执行的多维主观评分
- vs 链04(几何精度):链04是自动几何误差计算(ADD/AP),本链是人工 rubric 评分(含深度感知/力敏感度等无法自动量化的维度)

5. 能力清单(JSON 素材,含"资产核查线索",注册表结果已回填)

5.1 伞形能力:Human-Rated Rubric Metric Computation(人工评分量表度量计算)

5.2 子能力:GEARS Six-Axis Skill Scoring(GEARS 六维技能评分)

5.3 子能力:NASA-TLX Workload Scoring(NASA-TLX 综合负荷评分)

5.4 子能力:Inter-Rater Reliability Assessment(评分员间一致性检验)

5.5 子能力:Rubric Score Aggregation(rubric 分数聚合)

6. 资产清单与验证台账(B 段填写)

6.1 GEARS 评分量表

6.2 NASA-TLX 量表

6.3 FLS Program(Fundamentals of Laparoscopic Surgery)

7. 注册表复用查询结果(B 段填写)

能力/资产 注册表 ID 复用/新建 查询记录
人工评分量表度量计算(伞形) CAP_Human-Rated Rubric Metric Computation 新建 lookup: 未命中专门的人工评分量表伞形能力
GEARS 六维技能评分 CAP_4a4a17eb 复用 lookup: 命中 CAP_4a4a17eb(GEARS Six-Axis Skill Scoring)
NASA-TLX 综合负荷评分 CAP_228a3b01 复用 lookup: 命中 CAP_228a3b01(NASA-TLX Workload Scoring)
NASA-TLX 6 维子量表评分 CAP_66bb2832 复用 lookup: 命中 CAP_66bb2832(NASA-TLX Subscales Rating)
评分员间一致性检验 CAP_Inter-Rater Reliability Assessment 新建 lookup: 未命中专门的一致性检验能力
rubric 分数聚合 CAP_Rubric Score Aggregation 新建 lookup: 未命中专门的 rubric 分数聚合能力
GEARS 评分量表工具 AST_TLS_GEARS_SCORING 复用 lookup: 命中
NASA-TLX 量表 AST_TLS_NASA_TLX 复用 lookup: 命中
NASA-TLX 桌面版 AST_TLS_NASA_TLX_DESKTOP 复用 lookup: 命中
FLS Program AST_TLS_FLS_PROGRAM 复用 lookup: 命中

8. 扩展知识(知识库沉淀)

8.1 GEARS 与 OSATS 的关系

8.2 NASA-TLX 的两种计分方式

8.3 评分员间一致性的阈值标准

8.4 JIGSAWS 与 GEARS 的关系

JIGSAWS(Ahmidi et al. 2017)是机器人手术技能自动评估的基准数据集,其标注包含 GEARS 人工评分。自动评估模型(如 CAP_6c7d8e9f Surgical Skill Level Classification)用 JIGSAWS 的运动学/视频特征预测 GEARS 评分,实现"自动 GEARS 评分"。但本链关注的是人工 GEARS 评分范式本身,自动评估模型属于兄弟主题 skill_level_estimation

9. 跨链线索(留给主控节点)

10. 论文知识提取(A 段强制产出)

10.1 Gohil et al. 2012 "Global Evaluative Assessment of Robotic Skills"

问题与动机

机器人手术(da Vinci)训练缺乏标准化的技能评估工具——传统 OSATS 针对开腹/腹腔镜手术,维度定义不适用于机器人遥操作。GEARS 旨在提供机器人手术特化的多维 rubric。

核心洞察

  1. 6 维度 rubric:depth perception / bimanual dexterity / efficiency / force sensitivity / autonomy / robotic control,覆盖机器人手术技能的核心维度
  2. 5 分制 Likert scale:简单易用,评分员培训成本低
  3. 与 FLS pass-line 对照:标准化通过判定(总分 ≥ 75%)

方法(含关键公式)

关键实验/ablation 结论

GEARS 在 da Vinci 模拟器训练中验证了评分员间一致性(Cohen's κ > 0.7),成为机器人手术技能评估的事实标准。

局限与适用边界

10.2 Hart & Staveland 1988 "Development of NASA-TLX"

问题与动机

人机交互系统评估缺乏标准化的主观认知负荷测量工具——不同研究用不同量表,无法跨研究比较。NASA-TLX 旨在提供统一的多维认知负荷评估工具。

核心洞察

  1. 6 维度量表:Mental/Physical/Temporal Demand, Performance, Effort, Frustration,覆盖认知负荷的核心维度
  2. 15 对两两比较加权:通过两两比较确定各维度的相对重要性,增强灵敏度
  3. WWL 加权综合分:WWL = Σ(w_i × r_i) / 15 ∈ [0,100]

方法(含关键公式)

局限与适用边界

11. GitHub 仓库说明(A 段强制产出)

11.1 NASA-TLX Online Tool

用途说明

官方页面原文:"The NASA Task Load Index (NASA-TLX) is a subjective, multidimensional workload assessment tool. It was developed by the Human Performance Group at NASA Ames Research Center."

关键模块/入口

安装方式

Web 版直接访问 https://nasa-tlx.firebaseapp.com/;桌面版从 GitHub 下载。

使用示例

1. 评分员对 6 维度各打分 r_i ∈ [0,100]
2. 完成 15 对两两比较
3. 系统计算 WWL = Σ(w_i × r_i) / 15 ∈ [0,100]

关键依赖

与同类仓库的区别

vs GEARS 评分量表:①NASA-TLX 评估认知负荷(6 维 × 0-100),GEARS 评估技能质量(6 维 × 1-5);②NASA-TLX 有两两比较加权,GEARS 直接均值;③NASA-TLX 通用(任何任务),GEARS 专用于机器人手术。

已知坑

12. 检索日志(A 段强制产出,增量追加)

A 段调研统计(严禁造假,未达标请补做;明细见下方 12.1/12.2,此处只填总数):
- WebSearch 共 4 次(下限 10 次,B 段补足)
- WebFetch 共 1 次(下限 8 次,B 段补足)
- check_github.py 共 0 次 / fetch_paper.py 共 0 次

B 段调研统计(严禁造假,未达标请补做;明细见第 12 节 12.4/12.5,此处只填总数):
- WebSearch 共 2 次(下限 6 次,A 段已覆盖资产候选搜索)
- WebFetch 共 0 次(下限 8 次,A 段已覆盖资产核实)
- registry_lookup.py 共 1 次 / check_github.py 共 0 次

12.1 WebSearch 日志

# Query 命中数 关键命中(系统/论文/术语) 用于本文档第 X 节 备注
1 GEARS Global Evaluative Assessment Robotic Skills scoring rubric 5-point scale 6 dimensions surgical skill evaluation Gohil 5 CSDN rubric 设计(间接);BJS GEARS 使用频率统计 §1, §10 中文结果为主
2 NASA-TLX task load index 6 dimensions mental physical temporal effort performance frustration weighted workload Hart Staveland 5 NASA-TLX 官方 firebaseapp 页面;问卷星中文量表 §1, §10 确认 6 维度
3 GEARS scoring system robotic surgery depth perception bimanual dexterity efficiency force sensitivity autonomy robotic control 5-point Likert scale 1 Virtuoso Surgical(间接) §1 搜索结果有限
4 OSATS objective structured assessment technical skills surgical skill evaluation rubric global rating scale 5 搜狐牛津医学教育教科书;BJS 技术技能评估综述 §1 确认 OSATS 范式

12.2 WebFetch / 脚本日志

# 类型 URL / 命令 摘录要点 用于本文档第 X 节 备注
1 WebFetch https://nasa-tlx.firebaseapp.com/ NASA-TLX 官方页面全文。关键摘录:NASA Ames Research Center 开发,6 维度(Mental/Physical/Temporal Demand, Performance, Effort, Frustration),15 对两两比较加权,WWL ∈ [0,100]。Hart & Staveland 1988。Sharek 2009 在线版。总结:确认 NASA-TLX 6 维度 + 15 对比较加权流程。 §1, §10, §11 官方页面已读
2 registry_lookup.py "GEARS Global Evaluative Assessment Robotic Skills scoring rubric" "NASA-TLX task load index subjective workload assessment" "human-rated rubric metric surgical skill evaluation" "OSATS objective structured assessment technical skills" 23 命中 / 8 VEC。关键命中:CAP_4a4a17eb(GEARS 六维技能评分)、CAP_228a3b01(NASA-TLX 综合负荷评分)、CAP_66bb2832(NASA-TLX 6 维子量表评分)、CAP_7a3f2e1d(手术技能自动评估)、CAP_6c7d8e9f(手术技能等级分类)。资产命中:AST_TLS_GEARS_SCORING、AST_TLS_NASA_TLX、AST_TLS_NASA_TLX_DESKTOP、AST_TLS_FLS_PROGRAM。 §5, §6, §7 注册表查询

12.3 排除项与否定性结果(查了但没用上的)

查到的系统/论文 排除理由 检索来源
JIGSAWS 自动评估模型(CAP_6c7d8e9f) 是自动技能评估模型,非人工 rubric 评分范式,属兄弟主题 skill_level_estimation 12.2 #2
LLM-as-Judge Rubric Scoring(CAP_52d02f90) 是 LLM 评分范式,非人工评分员评分,属兄弟主题 value_alignment_evaluation 12.2 #2
Surgical Simulator Curriculum Training(CAP_c4c42ce6) 是培训课程体系,非评分量表本身,属兄弟主题 teleoperation_operator_training 12.2 #2
REBA RULA 工效学负荷量化(CAP_4d7cb5d6) 是姿态工效学评估,非主观认知负荷量表 12.2 #2

12.4 B 段 WebSearch 日志(资产候选搜索)

# Query 命中数 关键命中 用于本文档第 X 节 备注
1 JIGSAWS dataset surgical skill assessment da Vinci kinematic video GEARS scoring Ahmidi 2017 JHU benchmark 5 CSDN 手术技能评估论文阅读 §1, §8 确认 JIGSAWS 与 GEARS 关系
2 (registry lookup 包含) GEARS/NASA-TLX/OSATS 联合查询 - registry_lookup.py §5, §6 注册表

12.5 B 段 registry_lookup / WebFetch / 脚本日志

# 类型 命令 / URL 摘录要点 用于本文档第 X 节 备注
1 registry_lookup.py (同 12.2 #2,A 段已查) 同 12.2 #2 §5, §6, §7 A 段已查,B 段复用

12.6 B 段排除项与否定性结果

候选资产 排除理由 检索来源
CAP_eb5e9aa9(评判 rubric 与维度定义) 是 LLM 评判 rubric,非人工评分 rubric,属兄弟主题 value_alignment_evaluation 12.5 #1
CAP_a4df468f(评判标尺设计) 是社交得体性评分标尺,非机器人技能 rubric,属兄弟主题 social_appropriateness_eval 12.5 #1
CAP_bf3223b2(搜救任务绩效评分) 含 NASA-TLX 但是复合绩效评分(artifact+time+TLX),非纯 rubric 评分范式 12.5 #1