Files
RC_WheelLeg/01_doc/training_evolution.md
T

2.0 KiB

训练代码演进

本项目将“训练代码架构”和“训练产生的模型 checkpoint”分别管理。代码、奖励、课程或观测契约发生变化时形成新的 Git 版本;同一架构下继续训练产生的模型编号作为实验和部署工件记录。

版本 来源快照 主要目的
v0.4.0 uni_mjlab(1) 第一份完整的新 MJCF 与新 mjlab 训练工程
v0.5.0 uni_mjlab_new 扩大观测、延迟和动力学随机化,探索更强 Sim2Real 鲁棒性
v0.6.0 best 面向比赛越障重新设计奖励、课程、站姿和诊断体系

从随机化增强到比赛训练

v0.6.0 不是简单地继续增大 v0.5.0 的随机范围。实践中重新降低了部分噪声、延迟和动力学随机化强度,并把训练重点转向可控的比赛任务课程:

  • 投影重力噪声由 ±0.08 调回 ±0.05
  • 腿和轮动作最大随机延迟由 4 步调回 2 步。
  • 摩擦、刚度和阻尼随机化调回较窄范围。
  • 移除该阶段的连续机身外力扰动与腿部质量随机化。
  • 将 x、y 和 yaw 跟踪拆成独立奖励和独立指令课程。
  • 障碍由课程逐步释放,高墙训练地形改为五道重复横墙。
  • 增加楼梯侧向漂移和偏航漂移惩罚。
  • 增加大量只用于训练评估的误差、轮速、姿态和接触指标。

这种调整反映的是从“广泛鲁棒性探索”转向“比赛场景定向优化”,不表示 v0.5.0 被删除;它仍由对应 Tag 完整保留。

模型与比赛部署

比赛训练可能先获得基模,再修改参数继续训练和筛选 checkpoint。最终关系为:

训练代码架构:v0.6.0 / best
比赛 Rough 策略:model_6800.onnx
比赛真机工程:last_not_slalom_1050
比赛得分:1050

model_6800.onnx 是比赛最终部署工件,不用模型编号替代训练代码版本号。它已随比赛部署归档;当前规范目录为 05_software/real/sim2real_ros2_v3/policies/