LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

grpo-rl-training - 使用 GRPO 和 TRL 训练语言模型

提供使用 TRL、定制奖励函数和任务特定训练流程实现 GRPO 强化学习微调的指导。

标签

更新于: 2026-10-03

能力

典型输入

典型输出

该技能可以做什么

  • 准备聊天格式数据集
  • 定义组合奖励函数
  • 配置 GRPO 训练
  • 设置因果语言模型
  • 应用 LoRA 微调
  • 保存训练模型

输入

  • 训练数据集
  • 基础语言模型
  • 奖励函数
  • 训练配置
  • 标准答案

输出

  • 训练后的模型
  • 保存的模型文件
  • 训练日志
  • 训练检查点

要求

  • Transformers 4.47.0 或更高版本
  • TRL 0.14.0 或更高版本
  • Datasets 3.2.0 或更高版本
  • PEFT 0.14.0 或更高版本
  • PyTorch

来源

  • 规范: SKILL.md
后训练
强化学习
GRPO
TRL
RLHF
奖励建模
推理
DPO
PPO
结构化输出
准备聊天格式数据集
定义组合奖励函数
配置 GRPO 训练
设置因果语言模型
训练数据集
基础语言模型
奖励函数
训练后的模型
保存的模型文件
训练日志