slime-rl-training - 使用 slime 框架进行大模型 RL 后训练。
提供使用集成 Megatron-LM 与 SGLang 的 slime 框架进行大模型强化学习后训练的指导与工作流。
标签
更新于: 2026-09-24能力
典型输入
典型输出
该技能可以做什么
- 执行标准 GRPO 训练
- 运行异步强化学习训练
- 进行多轮 Agent 训练
- 配置 Megatron 与 SGLang 参数
- 管理训练数据缓冲区
输入
- 模型检查点
- JSONL 格式提示词数据
- 模型配置文件
- 自定义生成函数
输出
- 保存的模型检查点
- TensorBoard 日志与指标
- 生成的 Rollout 采样数据
要求
- Docker 或 PyTorch 运行环境
- 支持 CUDA 的 NVIDIA GPU
- torch >= 2.0.0
- transformers >= 4.40.0
- sglang-router >= 0.2.3
- Ray
