LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

具备该能力的 Skills:使用 DPO 对齐模型

浏览具备该能力的技能列表。

  • fine-tuning-with-trl - 使用 TRL 进行大语言模型后训练与偏好对齐
    后训练TRL强化学习微调

    ★ 0 · 更新于 2026-09-24

    提供大语言模型后训练的方法与工作流,涵盖 SFT、DPO、PPO、GRPO 及奖励模型训练。

    ⚙ 执行监督微调⚙ 训练奖励模型⚙ 使用 DPO 对齐模型