LogoClawIndex
案例技能关于
LogoClawIndex

distributed-training - 分布式训练并行策略

提供跨多GPU和节点扩展ML训练的并行策略指导

标签

更新于: 2026-03-10
机器学习分布式训练GPU并行深度学习

能力

跨多GPU训练选择并行策略同步梯度压缩梯度

典型输入

GPU集群训练数据集模型架构

典型输出

训练好的模型检查点文件训练指标

该技能可以做什么

  • 跨多GPU训练
  • 选择并行策略
  • 同步梯度
  • 压缩梯度
  • 卸载到CPU
  • 检查点状态
  • 故障恢复
  • 分析GPU利用率

输入

  • GPU集群
  • 训练数据集
  • 模型架构
  • 并行策略

输出

  • 训练好的模型
  • 检查点文件
  • 训练指标

要求

  • 多GPU环境
  • NCCL后端
  • torchrun
  • 分布式训练框架

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。