# 训练代码演进 本项目将“训练代码架构”和“训练产生的模型 checkpoint”分别管理。代码、奖励、课程或观测契约发生变化时形成新的 Git 版本;同一架构下继续训练产生的模型编号作为实验和部署工件记录。 | 版本 | 来源快照 | 主要目的 | | --- | --- | --- | | `v0.4.0` | `uni_mjlab(1)` | 第一份完整的新 MJCF 与新 mjlab 训练工程 | | `v0.5.0` | `uni_mjlab_new` | 扩大观测、延迟和动力学随机化,探索更强 Sim2Real 鲁棒性 | | `v0.6.0` | `best` | 面向比赛越障重新设计奖励、课程、站姿和诊断体系 | ## 从随机化增强到比赛训练 `v0.6.0` 不是简单地继续增大 `v0.5.0` 的随机范围。实践中重新降低了部分噪声、延迟和动力学随机化强度,并把训练重点转向可控的比赛任务课程: - 投影重力噪声由 `±0.08` 调回 `±0.05`。 - 腿和轮动作最大随机延迟由 4 步调回 2 步。 - 摩擦、刚度和阻尼随机化调回较窄范围。 - 移除该阶段的连续机身外力扰动与腿部质量随机化。 - 将 x、y 和 yaw 跟踪拆成独立奖励和独立指令课程。 - 障碍由课程逐步释放,高墙训练地形改为五道重复横墙。 - 增加楼梯侧向漂移和偏航漂移惩罚。 - 增加大量只用于训练评估的误差、轮速、姿态和接触指标。 这种调整反映的是从“广泛鲁棒性探索”转向“比赛场景定向优化”,不表示 `v0.5.0` 被删除;它仍由对应 Tag 完整保留。 ## 模型与比赛部署 比赛训练可能先获得基模,再修改参数继续训练和筛选 checkpoint。最终关系为: ```text 训练代码架构:v0.6.0 / best 比赛 Rough 策略:model_6800.onnx 比赛真机工程:last_not_slalom_1050 比赛得分:1050 ``` `model_6800.onnx` 是比赛最终部署工件,不用模型编号替代训练代码版本号。它已随比赛部署归档;当前规范目录为 `05_software/real/sim2real_ros2_v3/policies/`。