grpo-rl-training - 使用 GRPO 和 TRL 训练语言模型
提供使用 TRL、定制奖励函数和任务特定训练流程实现 GRPO 强化学习微调的指导。
标签
更新于: 2026-10-03能力
典型输入
典型输出
该技能可以做什么
- 准备聊天格式数据集
- 定义组合奖励函数
- 配置 GRPO 训练
- 设置因果语言模型
- 应用 LoRA 微调
- 保存训练模型
输入
- 训练数据集
- 基础语言模型
- 奖励函数
- 训练配置
- 标准答案
输出
- 训练后的模型
- 保存的模型文件
- 训练日志
- 训练检查点
要求
- Transformers 4.47.0 或更高版本
- TRL 0.14.0 或更高版本
- Datasets 3.2.0 或更高版本
- PEFT 0.14.0 或更高版本
- PyTorch
