RLinf 适配 OpenPI SFT 与 pi0.5 模型多卡训练简记 发表于 9 天前 最近使用 RLinf 框架适配了 pi0.5 模型的 SFT(Supervised Fine-Tuning)训练,在 Ascend …