LogoClawIndex
案例技能关于
LogoClawIndex

fine-tuning-with-trl - 使用 TRL 进行大语言模型后训练与偏好对齐

提供大语言模型后训练的方法与工作流,涵盖 SFT、DPO、PPO、GRPO 及奖励模型训练。

标签

更新于: 2026-09-24
后训练TRL强化学习微调SFTDPOPPOGRPORLHF偏好对齐HuggingFace

能力

执行监督微调训练奖励模型使用 DPO 对齐模型使用 PPO 优化策略

典型输入

指令数据集偏好数据集预训练语言模型

典型输出

保存的微调模型检查点训练完成的奖励模型生成的评估文本输出

该技能可以做什么

  • 执行监督微调
  • 训练奖励模型
  • 使用 DPO 对齐模型
  • 使用 PPO 优化策略
  • 使用 GRPO 进行在线强化学习
  • 评估对齐后的模型

输入

  • 指令数据集
  • 偏好数据集
  • 预训练语言模型
  • 奖励模型
  • 训练配置

输出

  • 保存的微调模型检查点
  • 训练完成的奖励模型
  • 生成的评估文本输出

要求

  • Python 环境
  • TRL 依赖包
  • Transformers 依赖包
  • Datasets 依赖包
  • PEFT 依赖包
  • Accelerate 依赖包
  • PyTorch 依赖包

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。