★ 0 · 更新于 2026-06-30
使用verl通过PPO、GRPO等强化学习算法大规模训练大语言模型
浏览使用该输入的技能列表。
★ 0 · 更新于 2026-06-30
使用verl通过PPO、GRPO等强化学习算法大规模训练大语言模型
★ 1 · 更新于 2026-06-30
支持多种算法和后端的大语言模型灵活强化学习训练库
★ 0 · 更新于 2026-06-30
使用verl库进行LLM的RLHF、GRPO和PPO强化学习训练
★ 2 · 更新于 2026-03-10
提供跨多GPU和节点扩展ML训练的并行策略指导