verl-rl-training - 大语言模型强化学习训练库强化学习RLHFGRPOPPO★ 650 · 更新于 2026-06-30提供使用 verl 库对大语言模型进行强化学习训练的指导⚙ 使用 RLHF 训练模型⚙ 使用 GRPO 训练模型⚙ 使用 PPO 训练模型
verl-rl-training - 使用verl库训练大语言模型强化学习RLHF模型训练分布式计算★ 1 · 更新于 2026-06-30支持多种算法和后端的大语言模型灵活强化学习训练库⚙ 使用GRPO算法训练LLM⚙ 使用PPO算法训练LLM⚙ 使用RLOO算法训练LLM
miles-rl-training - 企业级强化学习训练框架强化学习MoEFP8INT4★ 650 · 更新于 2026-05-11面向大规模MoE模型的企业级强化学习训练框架,支持FP8/INT4精度训练⚙ 训练MoE模型⚙ 配置FP8训练⚙ 配置INT4训练