slime-rl-training - 使用 slime 框架进行大模型 RL 后训练。强化学习Megatron-LMSGLangGRPO★ 0 · 更新于 2026-09-24提供使用集成 Megatron-LM 与 SGLang 的 slime 框架进行大模型强化学习后训练的指导与工作流。⚙ 执行标准 GRPO 训练⚙ 运行异步强化学习训练⚙ 进行多轮 Agent 训练