verl-rl-training - verl LLM强化学习训练框架
大语言模型强化学习训练库
标签
更新于: 2026-06-30能力
典型输入
典型输出
该技能可以做什么
- 训练模型
- 执行rollout
- 计算奖励
- 配置算法
- 切换后端
- 执行多轮rollout
- 训练视觉语言模型
- 启用LoRA
输入
- 基础模型
- 训练数据集
- 奖励函数
- 训练配置
输出
- 训练后的模型检查点
- 训练指标
要求
- Python 3.8+
- verl>=0.3.0
- torch>=2.0.0
- ray>=2.41.0
- vllm>=0.8.2
- transformers>=4.40.0
- GPU集群
- HuggingFace模型
