drpo-llm-rl - 用于稳定大模型强化学习的 DRPO 优化
通过平滑的优势加权二次正则项替代硬信任域掩码,以稳定大语言模型的强化学习后训练。
标签
更新于: 2026-09-15能力
典型输入
典型输出
该技能可以做什么
- 评估当前强化学习训练设置
- 设计 DRPO 二次正则化器
- 实现平滑策略正则化
- 诊断大模型强化学习训练不稳定性
- 验证梯度范数与收敛性
输入
- 大模型强化学习训练脚本
- 训练配置文件
- 损失曲线与奖励指标
输出
- DRPO 损失函数实现代码
- 更新后的训练配置文件
- 强化学习收敛性分析日志
要求
- 终端执行环境
- 大语言模型强化学习框架
