★ 0 · 更新于 2026-09-24
提供大语言模型后训练的方法与工作流,涵盖 SFT、DPO、PPO、GRPO 及奖励模型训练。
浏览带有该标签的技能列表。
★ 0 · 更新于 2026-09-24
提供大语言模型后训练的方法与工作流,涵盖 SFT、DPO、PPO、GRPO 及奖励模型训练。
★ 650 · 更新于 2026-06-30
提供使用 verl 库对大语言模型进行强化学习训练的指导
★ 0 · 更新于 2026-06-30
使用verl通过PPO、GRPO等强化学习算法大规模训练大语言模型
★ 1 · 更新于 2026-06-30
支持多种算法和后端的大语言模型灵活强化学习训练库
★ 0 · 更新于 2026-06-30
使用verl库进行LLM的RLHF、GRPO和PPO强化学习训练
★ 1 · 更新于 2026-06-30
大语言模型强化学习训练库