LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

verl-rl-training - 使用 verl 进行 LLM 强化学习训练

使用 verl 库通过强化学习算法训练大语言模型

标签

更新于: 2026-06-30
大语言模型强化学习训练分布式系统PPOGRPO

能力

典型输入

典型输出

该技能可以做什么

  • 实施 RLHF
  • 配置 GRPO
  • 运行 PPO
  • 训练分布式模型
  • 训练视觉语言模型
  • 配置多轮工具

输入

  • 训练数据集
  • 基础模型
  • 配置文件
  • 奖励函数

输出

  • 训练日志
  • 模型检查点
  • 性能指标
  • 评估结果

要求

  • GPU 集群
  • PyTorch
  • Ray
  • vLLM
  • transformers
  • verl

来源

  • 规范: SKILL.md
实施 RLHF
配置 GRPO
运行 PPO
训练分布式模型
训练数据集
基础模型
配置文件
训练日志
模型检查点
性能指标