YouDuck.ai

VelStand — 行走加跌倒恢复

最后更新

Mjlab-VelStand-Flat-MicroDuck
Mjlab-VelStand-Rough-MicroDuck

行走和跌倒恢复训练进同一个策略

和分开训的区别

运行时本来就能在策略之间热切换——所有策略共享 61 维观测契约,任何一个都能在任意时刻接管机器人。所以「行走」和「站起」完全可以是两个策略。

那为什么还要合训?

合训的策略在从跌倒到恢复行走的过渡上更连贯,因为它见过这段过渡。分开训的两个策略各自都很好,但交接那一瞬间谁都没专门学过。

代价是训练更难收敛——一个策略要同时学两件差别很大的事。

什么时候选它

想要机器人被推倒后自己爬起来继续走、中间不卡顿,选这个。想要每件事都训到最好、接受切换时的一点生硬,用 VelocityStandUp