★ 0 · 更新于 2026-09-24
提供大语言模型后训练的方法与工作流,涵盖 SFT、DPO、PPO、GRPO 及奖励模型训练。
浏览带有该标签的技能列表。
★ 0 · 更新于 2026-09-24
提供大语言模型后训练的方法与工作流,涵盖 SFT、DPO、PPO、GRPO 及奖励模型训练。
★ 0 · 更新于 2026-09-24
提供使用集成 Megatron-LM 与 SGLang 的 slime 框架进行大模型强化学习后训练的指导与工作流。
★ 3 · 更新于 2026-09-15
通过平滑的优势加权二次正则项替代硬信任域掩码,以稳定大语言模型的强化学习后训练。
★ 602 · 更新于 2026-06-30
提供使用 verl 库对大语言模型进行强化学习训练的指导
★ 0 · 更新于 2026-06-30
使用verl通过PPO、GRPO等强化学习算法大规模训练大语言模型
★ 1 · 更新于 2026-06-30
支持多种算法和后端的大语言模型灵活强化学习训练库
★ 0 · 更新于 2026-06-30
使用verl库进行LLM的RLHF、GRPO和PPO强化学习训练
★ 1 · 更新于 2026-06-30
大语言模型强化学习训练库
★ 0 · 更新于 2026-06-30
使用 verl 库通过强化学习算法训练大语言模型
★ 602 · 更新于 2026-05-11
面向大规模MoE模型的企业级强化学习训练框架,支持FP8/INT4精度训练