★ 0 · 更新于 2026-06-30
使用verl库进行LLM的RLHF、GRPO和PPO强化学习训练
浏览使用该输入的技能列表。
★ 0 · 更新于 2026-06-30
使用verl库进行LLM的RLHF、GRPO和PPO强化学习训练
★ 1 · 更新于 2026-06-30
大语言模型强化学习训练库
★ 22 · 更新于 2026-02-15
用于数据集设计、模型微调、评估和部署的算法与模型开发技能
★ 650 · 更新于 2026-02-14
使用优化内核和服务引擎部署微调模型进行生产推理