verl-rl-training - 大语言模型强化学习训练库强化学习RLHFGRPOPPO★ 650 · 更新于 2026-06-30提供使用 verl 库对大语言模型进行强化学习训练的指导⚙ 使用 RLHF 训练模型⚙ 使用 GRPO 训练模型⚙ 使用 PPO 训练模型
verl-rl-training - 使用Verl的大语言模型强化学习训练强化学习RLHF后训练分布式训练★ 0 · 更新于 2026-06-30使用verl通过PPO、GRPO等强化学习算法大规模训练大语言模型⚙ 使用PPO训练模型⚙ 使用GRPO训练模型⚙ 配置强化学习算法