LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

verl-rl-training - 使用verl库训练大语言模型

支持多种算法和后端的大语言模型灵活强化学习训练库

标签

更新于: 2026-06-30

能力

典型输入

典型输出

该技能可以做什么

  • 使用GRPO算法训练LLM
  • 使用PPO算法训练LLM
  • 使用RLOO算法训练LLM
  • 使用DAPO算法训练LLM
  • 使用REINFORCE++算法训练LLM
  • 使用ReMax算法训练LLM
  • 配置FSDP后端
  • 配置Megatron-LM后端
  • 配置vLLM推理引擎
  • 配置SGLang推理引擎
  • 运行分布式训练
  • 配置LoRA训练
  • 训练视觉语言模型
  • 启用多轮生成
  • 计算训练奖励

输入

  • 训练数据集
  • 基础模型
  • 训练配置
  • 奖励函数
  • GPU集群
  • 模型检查点

输出

  • 训练好的模型检查点
  • 训练指标
  • 奖励分数
  • 损失曲线
  • 评估结果

要求

  • 8个以上GPU的集群
  • Python 3.x
  • PyTorch 2.0.0+
  • Ray 2.41.0+
  • vLLM 0.8.2+
  • verl 0.3.0+

来源

  • 规范: SKILL.md
强化学习
RLHF
模型训练
分布式计算
大语言模型
PPO
GRPO
使用GRPO算法训练LLM
使用PPO算法训练LLM
使用RLOO算法训练LLM
使用DAPO算法训练LLM
训练数据集
基础模型
训练配置
训练好的模型检查点
训练指标
奖励分数