model-infer-parallel-impl - 实施昇腾 NPU 模型推理并行改造
根据已确认的并行配置,为基于 PyTorch 的昇腾 NPU 模型实施并行层、通信组、YAML 配置和权重处理改造。
标签
更新于: 2026-09-30能力
典型输入
典型输出
该技能可以做什么
- 确认并行配置
- 选择参考实现
- 创建通信组
- 替换并行层
- 适配 MoE 并行
- 生成 YAML 配置
- 实现权重处理
- 验证并行推理
输入
- 已确认的并行配置
- 目标模型代码仓库
- 单卡模型框架
- 参考模型实现
- 模型权重路径
输出
- 并行化模型代码
- 通信组定义
- YAML 配置文件
- 权重加载或转换实现
- 推理验证结果
要求
- PyTorch 运行环境
- 昇腾 NPU 环境
- HCCL 通信支持
- 已确认的 parallel_config
- 完整的单卡模型适配
- 模型源代码访问权限
