verl-rl-training - 使用verl库训练大语言模型
支持多种算法和后端的大语言模型灵活强化学习训练库
标签
更新于: 2026-06-30能力
典型输入
典型输出
该技能可以做什么
- 使用GRPO算法训练LLM
- 使用PPO算法训练LLM
- 使用RLOO算法训练LLM
- 使用DAPO算法训练LLM
- 使用REINFORCE++算法训练LLM
- 使用ReMax算法训练LLM
- 配置FSDP后端
- 配置Megatron-LM后端
- 配置vLLM推理引擎
- 配置SGLang推理引擎
- 运行分布式训练
- 配置LoRA训练
- 训练视觉语言模型
- 启用多轮生成
- 计算训练奖励
输入
- 训练数据集
- 基础模型
- 训练配置
- 奖励函数
- GPU集群
- 模型检查点
输出
- 训练好的模型检查点
- 训练指标
- 奖励分数
- 损失曲线
- 评估结果
要求
- 8个以上GPU的集群
- Python 3.x
- PyTorch 2.0.0+
- Ray 2.41.0+
- vLLM 0.8.2+
- verl 0.3.0+
