miles-rl-training - 企业级强化学习训练框架
面向大规模MoE模型的企业级强化学习训练框架,支持FP8/INT4精度训练
标签
更新于: 2026-05-11能力
典型输入
典型输出
该技能可以做什么
- 训练MoE模型
- 配置FP8训练
- 配置INT4训练
- 启用推测RL
- 记录专家路由
- 重放路由决策
输入
- 模型检查点
- 提示词数据集
- 草稿模型检查点
- 训练配置
输出
- 训练后的模型检查点
- 训练日志
- 损失指标
要求
- 支持FP8的H100/H200 GPU
- Docker环境
- CUDA
- sglang-router
- Ray
- PyTorch
- transformers
