distributed-training - 分布式训练并行策略提供跨多GPU和节点扩展ML训练的并行策略指导标签更新于: 2026-03-10机器学习分布式训练GPU并行深度学习能力跨多GPU训练选择并行策略同步梯度压缩梯度典型输入GPU集群训练数据集模型架构典型输出训练好的模型检查点文件训练指标该技能可以做什么跨多GPU训练选择并行策略同步梯度压缩梯度卸载到CPU检查点状态故障恢复分析GPU利用率输入GPU集群训练数据集模型架构并行策略输出训练好的模型检查点文件训练指标要求多GPU环境NCCL后端torchrun分布式训练框架来源规范: SKILL.md