fine-tuning-with-trl - 使用 TRL 进行大语言模型后训练与偏好对齐
提供大语言模型后训练的方法与工作流,涵盖 SFT、DPO、PPO、GRPO 及奖励模型训练。
标签
更新于: 2026-09-24该技能可以做什么
- 执行监督微调
- 训练奖励模型
- 使用 DPO 对齐模型
- 使用 PPO 优化策略
- 使用 GRPO 进行在线强化学习
- 评估对齐后的模型
输入
- 指令数据集
- 偏好数据集
- 预训练语言模型
- 奖励模型
- 训练配置
输出
- 保存的微调模型检查点
- 训练完成的奖励模型
- 生成的评估文本输出
要求
- Python 环境
- TRL 依赖包
- Transformers 依赖包
- Datasets 依赖包
- PEFT 依赖包
- Accelerate 依赖包
- PyTorch 依赖包
