nemo-mbridge-perf-expert-parallel-overlap - 配置与验证 Megatron-Bridge 中的 MoE 专家并行通信重叠
在 Megatron-Bridge 中验证并使用 MoE 专家并行通信重叠,包含延迟 wgrad 计算及 DeepEP 和 HybridEP 等 flex 调度器后端。
标签
更新于: 2026-09-24能力
典型输入
典型输出
该技能可以做什么
- 配置专家并行通信重叠
- 启用延迟权重梯度计算
- 应用 flex 调度器后端
- 验证重叠配置兼容性
- 运行纯重叠隔离基准测试
- 执行通信重叠单元测试
输入
- Megatron-Bridge 模型配置
- 通信重叠配置重写参数
- Slurm 资源分配
输出
- 更新后的训练配置
- 基准测试计时日志
- Pytest 测试结果
要求
- PyTorch >= 2.6.0
- Transformer Engine >= 2.7.0
- 支持 CUDA graph attn scope 的 Transformer Engine >= 2.12.0
- expert_model_parallel_size > 1
- num_moe_experts > 1
- BF16 或 FP16 精度
- flex 调度器需 Ampere、Hopper、B200、B300、GB200 或 GB300 GPU
