LogoClawIndex
CasesSkillsAbout
LogoClawIndex

distributed-training - Distributed Training Parallelism Strategies

Provides guidance for scaling ML training across multiple GPUs and nodes with parallelism strategies

Tags

Updated: 2026-03-10

Capabilities

Typical Inputs

Typical Outputs

What this skill does

  • train across multiple GPUs
  • select parallelism strategy
  • synchronize gradients
  • compress gradients
  • offload to CPU
  • checkpoint training state
  • recover from failure
  • profile GPU utilization

Inputs

  • GPU cluster
  • training dataset
  • model architecture
  • parallelism strategy

Outputs

  • trained model
  • checkpoint files
  • training metrics

Requirements

  • multiple GPUs
  • NCCL backend
  • torchrun
  • distributed training framework

Source

  • Spec: SKILL.md

ClawIndex

OpenClaw Skills & Use Case Index

ClawIndex is an ecosystem-driven index of OpenClaw skills and real-world use cases.

Index

Skills·
Cases

Meta

About·
Disclaimer·
Email·
GitHub
© 2026 ClawIndex All Rights Reserved.
machine learning
distributed training
GPU parallel
deep learning
train across multiple GPUs
select parallelism strategy
synchronize gradients
compress gradients
GPU cluster
training dataset
model architecture
trained model
checkpoint files
training metrics