评估用于在当前物理场景中运行已经训练好的策略模型,观察机器人在仿真环境中的控制效果。它不会在平台内重新训练策略,也不会生成新的模型文件;它的作用是读取用户提供的策略模型,将当前场景提交给云端求解器计算,并在视图区中显示机器人运动结果。
使用评估前,请确认以下条件:
上传入口支持 .pt、.pth、.onnx、.zip,单个文件最大 200MB。当前正式评估以 .pt 策略为主。
策略评估可以理解为“把训练好的控制器放回物理场景中试跑”。
在评估过程中,系统会根据当前仿真状态构造策略需要的观测量,例如基座速度、角速度、重力方向、速度指令、关节位置、关节速度、上一帧动作或步态相位。策略模型读取这些观测量后输出动作,动作会被转换为机器人关节控制目标,再由物理求解器计算机器人运动。
评估过程中,视图区会持续显示机器人姿态、关节运动、接触和整体运动趋势。评估结束后,可以通过回放查看完整过程。
评估配置面板分为五个部分:评估模型、驱动关节、观测模板、缩放系数、运动指令。一般建议按标签页从左到右依次检查。
“评估模型”页用于上传或选择已经上传过的策略模型。
上传模型后,系统会尝试探测模型的输入观测维度和输出动作维度。维度信息用于检查当前场景配置是否与策略模型匹配。
需要注意:
“驱动关节”页会扫描当前场景中的非 fixed 关节,并列出可作为策略动作输出目标的关节。
关节顺序非常重要。策略输出的第 1 维、第 2 维、第 3 维会按顺序映射到对应关节。如果顺序错误,即使模型本身正确,机器人也可能出现抖动、反向运动、姿态失稳或直接倒下。
系统会尝试识别常见机器人类型,并根据机型自动推荐关节顺序。
评估模式下,关节姿态、刚度、阻尼、仿真时长等主要使用当前场景中的设置,用户不需要在评估面板中重复配置。
观测模板决定系统如何把当前仿真状态整理成策略输入。
当前支持两类模板:
系统会根据被选中的驱动关节数量计算观测维度,并与模型探测到的输入维度进行对比。若维度不一致,需要切换模板、调整关节数量,或更换与当前机器人匹配的策略模型。
缩放系数用于保持策略输入输出与训练时一致。错误的缩放系数会改变策略看到的状态,也会改变动作实际作用到关节上的幅度。
常见字段包括:
ang_vel_scale:角速度缩放。dof_pos_scale:关节位置缩放。dof_vel_scale:关节速度缩放。lin_vel_scale:线速度缩放,部分观测模板会使用。action_scale:策略输出动作缩放。cmd_scale:速度指令缩放,包括线速度和角速度指令。这些参数应尽量与策略训练或部署配置保持一致。如果策略来自外部训练工程,建议把训练配置中的缩放参数整理出来,再填入评估面板。
运动指令用于控制策略期望的运动方向。
cmd_init [vx, vy, yaw] 表示评估开始时的默认速度指令:
vx:前后方向速度。vy:左右方向速度。yaw:偏航角速度。评估运行中可以使用键盘实时修改指令:
当焦点位于输入框、文本框、下拉框或可编辑文本区域中时,WASD 不会生效,避免影响参数输入。松开按键后,系统会回到当前默认指令;如果同时按下前进和后退,或同时按下左转和右转,对应方向会相互抵消。
一次完整评估通常包括以下步骤:
评估运行时,视图区会实时更新机器人姿态。用户可以观察:
评估完成后,系统会进入回放模式,并显示回放控制条。用户可以暂停、播放、拖动时间进度,检查机器人在不同时间点的运动状态。
可能原因:
可能原因:
fixed。可能原因:
优先检查:
优先检查:
action_scale 和关节 PD 参数。