verl-rl-training - 使用 verl 进行 LLM 强化学习训练使用 verl 库通过强化学习算法训练大语言模型标签更新于: 2026-06-30大语言模型强化学习训练分布式系统PPOGRPO能力典型输入典型输出该技能可以做什么实施 RLHF配置 GRPO运行 PPO训练分布式模型训练视觉语言模型配置多轮工具输入训练数据集基础模型配置文件奖励函数输出训练日志模型检查点性能指标评估结果要求GPU 集群PyTorchRayvLLMtransformersverl来源规范: SKILL.md