LogoClawIndex
CasesSkillsAbout
LogoClawIndex

ClawIndex

OpenClaw Skills & Use Case Index

ClawIndex is an ecosystem-driven index of OpenClaw skills and real-world use cases.

Index

Skills·
Cases

Meta

About·
Disclaimer·
Email·
GitHub
© 2026 ClawIndex All Rights Reserved.

drpo-llm-rl - DRPO for stable LLM reinforcement learning

Replaces hard trust-region masks with a smooth advantage-weighted quadratic regularizer to stabilize LLM reinforcement learning.

Tags

Updated: 2026-09-15

Capabilities

Typical Inputs

Typical Outputs

What this skill does

  • Assess current RL training setup
  • Design DRPO quadratic regularizer
  • Implement smooth policy regularization
  • Diagnose LLM RL training instability
  • Validate gradient norms and convergence

Inputs

  • LLM RL training scripts
  • Training configurations
  • Loss curves and reward metrics

Outputs

  • DRPO loss implementation code
  • Updated training configuration files
  • RL convergence analysis logs

Requirements

  • Terminal execution environment
  • LLM reinforcement learning framework

Source

  • Spec: SKILL.md
DRPO
LLM RL
Reinforcement Learning
Policy Optimization
Trust Region
Assess current RL training setup
Design DRPO quadratic regularizer
Implement smooth policy regularization
Diagnose LLM RL training instability
LLM RL training scripts
Training configurations
Loss curves and reward metrics
DRPO loss implementation code
Updated training configuration files
RL convergence analysis logs