评估

评估用于在当前物理场景中运行已经训练好的策略模型,观察机器人在仿真环境中的控制效果。它不会在平台内重新训练策略,也不会生成新的模型文件;它的作用是读取用户提供的策略模型,将当前场景提交给云端求解器计算,并在视图区中显示机器人运动结果。

使用前提

使用评估前,请确认以下条件:

  • 场景中存在机器人结构,通常来自 URDF 导入。
  • 被评估的关节名称和顺序需要能与策略模型的动作维度对应。
  • 当前账号具备机器人评估权限。
  • 当前没有正在运行的仿真、训练或评估任务。

上传入口支持 .pt.pth.onnx.zip,单个文件最大 200MB。当前正式评估以 .pt 策略为主。

什么是策略评估

策略评估可以理解为“把训练好的控制器放回物理场景中试跑”。

在评估过程中,系统会根据当前仿真状态构造策略需要的观测量,例如基座速度、角速度、重力方向、速度指令、关节位置、关节速度、上一帧动作或步态相位。策略模型读取这些观测量后输出动作,动作会被转换为机器人关节控制目标,再由物理求解器计算机器人运动。

评估过程中,视图区会持续显示机器人姿态、关节运动、接触和整体运动趋势。评估结束后,可以通过回放查看完整过程。

评估配置

评估配置面板分为五个部分:评估模型、驱动关节、观测模板、缩放系数、运动指令。一般建议按标签页从左到右依次检查。

评估模型

“评估模型”页用于上传或选择已经上传过的策略模型。

上传模型后,系统会尝试探测模型的输入观测维度和输出动作维度。维度信息用于检查当前场景配置是否与策略模型匹配。

需要注意:

  • 策略输入维度必须等于当前观测模板计算出的观测维度。
  • 策略输出维度通常应等于被选中的驱动关节数量。
  • 如果维度不一致,系统会阻止开始评估,并提示调整关节选择、观测模板或模型文件。

驱动关节

“驱动关节”页会扫描当前场景中的非 fixed 关节,并列出可作为策略动作输出目标的关节。

关节顺序非常重要。策略输出的第 1 维、第 2 维、第 3 维会按顺序映射到对应关节。如果顺序错误,即使模型本身正确,机器人也可能出现抖动、反向运动、姿态失稳或直接倒下。

系统会尝试识别常见机器人类型,并根据机型自动推荐关节顺序。

评估模式下,关节姿态、刚度、阻尼、仿真时长等主要使用当前场景中的设置,用户不需要在评估面板中重复配置。

观测模板

观测模板决定系统如何把当前仿真状态整理成策略输入。

当前支持两类模板:

  • 人形部署:适合人形机器人部署策略。观测内容通常包括角速度、重力方向、速度指令、关节位置、关节速度、上一帧动作和步态相位。
  • 四足部署:适合四足机器人策略。观测内容通常包括基座线速度、角速度、重力方向、速度指令、关节位置、关节速度和上一帧动作。

系统会根据被选中的驱动关节数量计算观测维度,并与模型探测到的输入维度进行对比。若维度不一致,需要切换模板、调整关节数量,或更换与当前机器人匹配的策略模型。

缩放系数

缩放系数用于保持策略输入输出与训练时一致。错误的缩放系数会改变策略看到的状态,也会改变动作实际作用到关节上的幅度。

常见字段包括:

  • ang_vel_scale:角速度缩放。
  • dof_pos_scale:关节位置缩放。
  • dof_vel_scale:关节速度缩放。
  • lin_vel_scale:线速度缩放,部分观测模板会使用。
  • action_scale:策略输出动作缩放。
  • cmd_scale:速度指令缩放,包括线速度和角速度指令。

这些参数应尽量与策略训练或部署配置保持一致。如果策略来自外部训练工程,建议把训练配置中的缩放参数整理出来,再填入评估面板。

运动指令

运动指令用于控制策略期望的运动方向。

cmd_init [vx, vy, yaw] 表示评估开始时的默认速度指令:

  • vx:前后方向速度。
  • vy:左右方向速度。
  • yaw:偏航角速度。

评估运行中可以使用键盘实时修改指令:

  • W:前进。
  • S:后退。
  • A:左转。
  • D:右转。

当焦点位于输入框、文本框、下拉框或可编辑文本区域中时,WASD 不会生效,避免影响参数输入。松开按键后,系统会回到当前默认指令;如果同时按下前进和后退,或同时按下左转和右转,对应方向会相互抵消。

评估流程

一次完整评估通常包括以下步骤:

  1. 导入机器人场景,例如 URDF 机器人。
  2. 检查机器人初始姿态、关节方向、碰撞体和地面。
  3. 点击顶部工具栏中的“评估”。
  4. 上传或选择策略模型。
  5. 检查模型观测维度和动作维度。
  6. 在“驱动关节”中确认关节数量和顺序。
  7. 选择合适的观测模板。
  8. 检查缩放系数和运动指令。
  9. 点击“开始评估”。
  10. 在视图区观察机器人运动,并可用 WASD 调整速度指令。
  11. 评估结束后,通过回放查看完整结果。

评估结果查看

评估运行时,视图区会实时更新机器人姿态。用户可以观察:

  • 机器人是否保持稳定姿态。
  • 关节运动是否符合策略预期。
  • 足端或末端执行器是否按预期接触环境。
  • 机器人是否出现抖动、反向运动、倒地或穿透。
  • WASD 指令是否能改变运动方向。
  • 地面、障碍物或高度场是否和机器人发生合理接触。

评估完成后,系统会进入回放模式,并显示回放控制条。用户可以暂停、播放、拖动时间进度,检查机器人在不同时间点的运动状态。

常见问题

评估按钮不可点击

可能原因:

  • 当前正在运行仿真、训练或评估。
  • 当前账号没有评估权限。
  • 场景中没有可评估的机器人结构。

场景中未检测到非 fixed 关节

可能原因:

  • 尚未导入 URDF 机器人。
  • 导入后关节类型全部为 fixed
  • 机器人层级不完整,关节没有被正确识别。
  • 当前选中的结构不是机器人根节点或包含关节的子树。

策略维度不匹配

可能原因:

  • 驱动关节数量和策略动作维度不一致。
  • 关节顺序模板与策略训练时不一致。
  • 观测模板选择错误。
  • 策略模型不是为当前机器人训练的。
  • 模型文件上传错误或选择了旧版本模型。

机器人一开始就倒下

优先检查:

  • 初始姿态是否接近策略训练时的站立姿态。
  • 关节方向和关节限位是否正确。
  • 驱动关节顺序是否与策略输出一致。
  • 地面高度、碰撞体、质量和惯量是否合理。
  • 缩放系数和动作幅度是否过大。

机器人剧烈抖动或动作反向

优先检查:

  • 关节映射顺序。
  • action_scale 和关节 PD 参数。
  • 观测模板是否与模型训练配置一致。
  • 关节名称是否和训练时一致。
  • 左右腿、左右臂或足端 link 是否映射反了。