drpo-llm-rl - 用于稳定大模型强化学习的 DRPO 优化DRPO大模型强化学习强化学习策略优化更新于 2026-09-15通过平滑的优势加权二次正则项替代硬信任域掩码,以稳定大语言模型的强化学习后训练。⚙ 评估当前强化学习训练设置⚙ 设计 DRPO 二次正则化器⚙ 实现平滑策略正则化