LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

nemo-mbridge-perf-expert-parallel-overlap - 配置与验证 Megatron-Bridge 中的 MoE 专家并行通信重叠

在 Megatron-Bridge 中验证并使用 MoE 专家并行通信重叠,包含延迟 wgrad 计算及 DeepEP 和 HybridEP 等 flex 调度器后端。

标签

更新于: 2026-09-24

能力

典型输入

典型输出

该技能可以做什么

  • 配置专家并行通信重叠
  • 启用延迟权重梯度计算
  • 应用 flex 调度器后端
  • 验证重叠配置兼容性
  • 运行纯重叠隔离基准测试
  • 执行通信重叠单元测试

输入

  • Megatron-Bridge 模型配置
  • 通信重叠配置重写参数
  • Slurm 资源分配

输出

  • 更新后的训练配置
  • 基准测试计时日志
  • Pytest 测试结果

要求

  • PyTorch >= 2.6.0
  • Transformer Engine >= 2.7.0
  • 支持 CUDA graph attn scope 的 Transformer Engine >= 2.12.0
  • expert_model_parallel_size > 1
  • num_moe_experts > 1
  • BF16 或 FP16 精度
  • flex 调度器需 Ampere、Hopper、B200、B300、GB200 或 GB300 GPU

来源

  • 规范: SKILL.md
Megatron-Bridge
MoE
专家并行
通信重叠
DeepEP
HybridEP
配置专家并行通信重叠
启用延迟权重梯度计算
应用 flex 调度器后端
验证重叠配置兼容性
Megatron-Bridge 模型配置
通信重叠配置重写参数
Slurm 资源分配
更新后的训练配置
基准测试计时日志
Pytest 测试结果