fine-tuning-with-trl - 使用 TRL 进行大语言模型后训练与偏好对齐后训练TRL强化学习微调★ 0 · 更新于 2026-09-24提供大语言模型后训练的方法与工作流,涵盖 SFT、DPO、PPO、GRPO 及奖励模型训练。⚙ 执行监督微调⚙ 训练奖励模型⚙ 使用 DPO 对齐模型