LogoClawIndex
案例技能关于
LogoClawIndex

drpo-llm-rl - 用于稳定大模型强化学习的 DRPO 优化

通过平滑的优势加权二次正则项替代硬信任域掩码,以稳定大语言模型的强化学习后训练。

标签

更新于: 2026-09-15
DRPO大模型强化学习强化学习策略优化信任域

能力

典型输入

典型输出

该技能可以做什么

  • 评估当前强化学习训练设置
  • 设计 DRPO 二次正则化器
  • 实现平滑策略正则化
  • 诊断大模型强化学习训练不稳定性
  • 验证梯度范数与收敛性

输入

  • 大模型强化学习训练脚本
  • 训练配置文件
  • 损失曲线与奖励指标

输出

  • DRPO 损失函数实现代码
  • 更新后的训练配置文件
  • 强化学习收敛性分析日志

要求

  • 终端执行环境
  • 大语言模型强化学习框架

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
评估当前强化学习训练设置
设计 DRPO 二次正则化器
实现平滑策略正则化
诊断大模型强化学习训练不稳定性
大模型强化学习训练脚本
训练配置文件
损失曲线与奖励指标
DRPO 损失函数实现代码
更新后的训练配置文件
强化学习收敛性分析日志