verl-rl-training - 使用verl进行LLM强化学习训练
使用verl库进行LLM的RLHF、GRPO和PPO强化学习训练
标签
更新于: 2026-06-30能力
典型输入
典型输出
该技能可以做什么
- 训练LLM
- 配置算法
- 准备数据集
- 定义奖励函数
- 创建训练配置
- 启动训练
- 监控训练
- 运行评估
- 管理集群
- 转换模型
输入
- 数据集
- 基础模型
- 奖励函数
- 训练配置
- GPU集群
输出
- 训练好的模型
- 训练指标
- 评估结果
要求
- verl>=0.3.0
- torch>=2.0.0
- ray>=2.41.0
- vllm>=0.8.2
- transformers>=4.40.0
- GPU集群
- Python环境
