grpo-rl-training - 使用 GRPO 和 TRL 训练语言模型后训练强化学习GRPOTRL★ 1 · 更新于 2026-10-03提供使用 TRL、定制奖励函数和任务特定训练流程实现 GRPO 强化学习微调的指导。⚙ 准备聊天格式数据集⚙ 定义组合奖励函数⚙ 配置 GRPO 训练