LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

verl-rl-training - 使用Verl的大语言模型强化学习训练

使用verl通过PPO、GRPO等强化学习算法大规模训练大语言模型

标签

更新于: 2026-06-30

能力

典型输入

典型输出

该技能可以做什么

  • 使用PPO训练模型
  • 使用GRPO训练模型
  • 配置强化学习算法
  • 管理分布式训练
  • 部署FSDP后端
  • 部署Megatron-LM后端
  • 处理多轮生成
  • 训练视觉语言模型

输入

  • 基座模型
  • 训练数据集
  • GPU集群
  • 奖励函数
  • 训练配置
  • 算法选择

输出

  • 训练模型检查点
  • 训练指标
  • 评估结果
  • 奖励日志

要求

  • verl>=0.3.0
  • torch>=2.0.0
  • ray>=2.41.0
  • vllm>=0.8.2
  • transformers>=4.40.0
  • 8+ GPU
  • Python环境

来源

  • 规范: SKILL.md
强化学习
RLHF
后训练
分布式训练
PPO
GRPO
大语言模型
机器学习
使用PPO训练模型
使用GRPO训练模型
配置强化学习算法
管理分布式训练
基座模型
训练数据集
GPU集群
训练模型检查点
训练指标
评估结果