drpo-llm-rl - DRPO for stable LLM reinforcement learning
Replaces hard trust-region masks with a smooth advantage-weighted quadratic regularizer to stabilize LLM reinforcement learning.
Tags
Updated: 2026-09-15Capabilities
Typical Inputs
Typical Outputs
What this skill does
- Assess current RL training setup
- Design DRPO quadratic regularizer
- Implement smooth policy regularization
- Diagnose LLM RL training instability
- Validate gradient norms and convergence
Inputs
- LLM RL training scripts
- Training configurations
- Loss curves and reward metrics
Outputs
- DRPO loss implementation code
- Updated training configuration files
- RL convergence analysis logs
Requirements
- Terminal execution environment
- LLM reinforcement learning framework
