LogoClawIndex
案例技能关于
LogoClawIndex

slime-rl-training - 使用 slime 框架进行大模型 RL 后训练。

提供使用集成 Megatron-LM 与 SGLang 的 slime 框架进行大模型强化学习后训练的指导与工作流。

标签

更新于: 2026-09-24

能力

典型输入

典型输出

该技能可以做什么

  • 执行标准 GRPO 训练
  • 运行异步强化学习训练
  • 进行多轮 Agent 训练
  • 配置 Megatron 与 SGLang 参数
  • 管理训练数据缓冲区

输入

  • 模型检查点
  • JSONL 格式提示词数据
  • 模型配置文件
  • 自定义生成函数

输出

  • 保存的模型检查点
  • TensorBoard 日志与指标
  • 生成的 Rollout 采样数据

要求

  • Docker 或 PyTorch 运行环境
  • 支持 CUDA 的 NVIDIA GPU
  • torch >= 2.0.0
  • transformers >= 4.40.0
  • sglang-router >= 0.2.3
  • Ray

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
强化学习
Megatron-LM
SGLang
GRPO
后训练
GLM
执行标准 GRPO 训练
运行异步强化学习训练
进行多轮 Agent 训练
配置 Megatron 与 SGLang 参数
模型检查点
JSONL 格式提示词数据
模型配置文件
保存的模型检查点
TensorBoard 日志与指标
生成的 Rollout 采样数据