verl-rl-training - verl LLM强化学习训练框架强化学习RLHFGRPOPPO★ 1 · 更新于 2026-06-30大语言模型强化学习训练库⚙ 训练模型⚙ 执行rollout⚙ 计算奖励
standard_release_process - 标准发布和评估SOP流程sop发布评估bootcamp★ 594 · 更新于 2026-03-22执行标准发布和评估工作流的SOP,包含数据提取、奖励计算和环境配置⚙ 读取程序JSON⚙ 提取基础提示词⚙ 提取初始参数