LogoClawIndex
CasesSkillsAbout
LogoClawIndex

ClawIndex

OpenClaw Skills & Use Case Index

ClawIndex is an ecosystem-driven index of OpenClaw skills and real-world use cases.

Index

Skills·
Cases

Meta

About·
Disclaimer·
Email·
GitHub
© 2026 ClawIndex All Rights Reserved.

Skills tagged: Reinforcement Learning

Browse skills that share this tag.

  • fine-tuning-with-trl - Post-training and preference alignment for LLMs with TRL
    Post-TrainingTRLReinforcement LearningFine-Tuning

    ★ 0 · Updated 2026-09-24

    Provides methods and workflows for LLM post-training, including SFT, DPO, PPO, GRPO, and reward modeling.

    ⚙ Execute supervised fine-tuning⚙ Train reward models⚙ Align models using DPO
  • slime-rl-training - LLM RL post-training using Megatron-LM and SGLang.
    Reinforcement LearningMegatron-LMSGLangGRPO

    ★ 0 · Updated 2026-09-24

    Provides guidance and workflows for LLM post-training with RL using the slime framework integrating Megatron-LM and SGLang.

    ⚙ Execute standard GRPO training⚙ Run asynchronous RL training⚙ Conduct multi-turn agentic training
  • drpo-llm-rl - DRPO for stable LLM reinforcement learning
    DRPOLLM RLReinforcement LearningPolicy Optimization

    ★ 3 · Updated 2026-09-15

    Replaces hard trust-region masks with a smooth advantage-weighted quadratic regularizer to stabilize LLM reinforcement learning.

    ⚙ Assess current RL training setup⚙ Design DRPO quadratic regularizer⚙ Implement smooth policy regularization
  • verl-rl-training - RL Training Library for LLMs
    Reinforcement LearningRLHFGRPOPPO

    ★ 602 · Updated 2026-06-30

    Provides guidance for training LLMs with RL using verl library

    ⚙ train models with RLHF⚙ train models with GRPO⚙ train models with PPO
  • verl-rl-training - LLM Reinforcement Learning Training with Verl
    Reinforcement LearningRLHFPost-TrainingDistributed Training

    ★ 0 · Updated 2026-06-30

    Train LLMs at scale using verl with PPO, GRPO, and other RL algorithms

    ⚙ train models with PPO⚙ train models with GRPO⚙ configure RL algorithms
  • verl-rl-training - Train LLMs with verl RL library
    Reinforcement LearningRLHFModel TrainingDistributed Computing

    ★ 1 · Updated 2026-06-30

    Flexible RL training library for large language models supporting multiple algorithms and backends

    ⚙ train LLM with GRPO algorithm⚙ train LLM with PPO algorithm⚙ train LLM with RLOO algorithm
  • verl-rl-training - LLM Reinforcement Learning Training with verl
    Reinforcement LearningRLHFGRPOPPO

    ★ 0 · Updated 2026-06-30

    Train LLMs with RLHF, GRPO, and PPO using verl library

    ⚙ train LLMs⚙ configure algorithm⚙ prepare dataset
  • verl-rl-training - verl: LLM RL Training Framework
    Reinforcement LearningRLHFGRPOPPO

    ★ 1 · Updated 2026-06-30

    Flexible RL training library for large language models

    ⚙ train models⚙ run rollout⚙ compute reward
  • verl-rl-training - RL Training for LLMs with verl
    LLMReinforcement LearningTrainingDistributed Systems

    ★ 0 · Updated 2026-06-30

    Train large language models with reinforcement learning algorithms using the verl library

    ⚙ implement RLHF⚙ configure GRPO⚙ run PPO
  • miles-rl-training - Enterprise RL Training Framework
    Reinforcement LearningMoEFP8INT4

    ★ 602 · Updated 2026-05-11

    Enterprise-grade RL training framework for large MoE models with FP8/INT4 support

    ⚙ train MoE models⚙ configure FP8 training⚙ configure INT4 training