verl-rl-training - 使用Verl的大语言模型强化学习训练
使用verl通过PPO、GRPO等强化学习算法大规模训练大语言模型
标签
更新于: 2026-06-30能力
典型输入
典型输出
该技能可以做什么
- 使用PPO训练模型
- 使用GRPO训练模型
- 配置强化学习算法
- 管理分布式训练
- 部署FSDP后端
- 部署Megatron-LM后端
- 处理多轮生成
- 训练视觉语言模型
输入
- 基座模型
- 训练数据集
- GPU集群
- 奖励函数
- 训练配置
- 算法选择
输出
- 训练模型检查点
- 训练指标
- 评估结果
- 奖励日志
要求
- verl>=0.3.0
- torch>=2.0.0
- ray>=2.41.0
- vllm>=0.8.2
- transformers>=4.40.0
- 8+ GPU
- Python环境
