moe-training - 训练稀疏混合专家模型
使用 DeepSpeed 或 HuggingFace 训练和优化稀疏混合专家模型,涵盖路由、负载均衡、专家并行和推理优化。
标签
更新于: 2026-09-29能力
典型输入
典型输出
该技能可以做什么
- 实现稀疏 MoE 架构
- 配置 Top-k 路由
- 平衡专家利用率
- 跨设备分布专家
- 配置 DeepSpeed MoE 训练
- 优化稀疏推理
输入
- 训练数据
- 模型架构配置
- 训练超参数
- 词汇表文件
- 合并文件
- DeepSpeed 配置
输出
- 训练后的 MoE 模型检查点
- 训练指标
- 评估指标
- 推理结果
要求
- Python 环境
- PyTorch
- DeepSpeed 或 HuggingFace Transformers
- HuggingFace Accelerate
- 用于专家并行的多 GPU 资源
