LogoClawIndex
案例技能关于
LogoClawIndex

verl-rl-training - 使用verl进行LLM强化学习训练

使用verl库进行LLM的RLHF、GRPO和PPO强化学习训练

标签

更新于: 2026-06-30
强化学习RLHFGRPOPPO后训练分布式训练

能力

典型输入

典型输出

该技能可以做什么

  • 训练LLM
  • 配置算法
  • 准备数据集
  • 定义奖励函数
  • 创建训练配置
  • 启动训练
  • 监控训练
  • 运行评估
  • 管理集群
  • 转换模型

输入

  • 数据集
  • 基础模型
  • 奖励函数
  • 训练配置
  • GPU集群

输出

  • 训练好的模型
  • 训练指标
  • 评估结果

要求

  • verl>=0.3.0
  • torch>=2.0.0
  • ray>=2.41.0
  • vllm>=0.8.2
  • transformers>=4.40.0
  • GPU集群
  • Python环境

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
训练LLM
配置算法
准备数据集
定义奖励函数
数据集
基础模型
奖励函数
训练好的模型
训练指标
评估结果