★ 0 · 更新于 2026-09-24
提供大语言模型后训练的方法与工作流,涵盖 SFT、DPO、PPO、GRPO 及奖励模型训练。
浏览带有该标签的技能列表。
★ 0 · 更新于 2026-09-24
提供大语言模型后训练的方法与工作流,涵盖 SFT、DPO、PPO、GRPO 及奖励模型训练。
★ 1 · 更新于 2026-09-24
提供使用集成 Megatron-LM 与 SGLang 的 slime 框架进行大模型强化学习后训练的指导与工作流。
★ 9 · 更新于 2026-09-16
提供无需参考模型的语言模型偏好优化与对齐训练方法。
★ 650 · 更新于 2026-06-30
提供使用 verl 库对大语言模型进行强化学习训练的指导
★ 0 · 更新于 2026-06-30
使用verl通过PPO、GRPO等强化学习算法大规模训练大语言模型
★ 0 · 更新于 2026-06-30
使用verl库进行LLM的RLHF、GRPO和PPO强化学习训练
★ 1 · 更新于 2026-06-30
大语言模型强化学习训练库