verl-rl-training - 使用verl库训练大语言模型强化学习RLHF模型训练分布式计算★ 1 · 更新于 2026-06-30支持多种算法和后端的大语言模型灵活强化学习训练库⚙ 使用GRPO算法训练LLM⚙ 使用PPO算法训练LLM⚙ 使用RLOO算法训练LLM