★ 1 · 更新于 2026-10-03
提供使用 TRL、定制奖励函数和任务特定训练流程实现 GRPO 强化学习微调的指导。
浏览产出该输出的技能列表。
★ 1 · 更新于 2026-10-03
提供使用 TRL、定制奖励函数和任务特定训练流程实现 GRPO 强化学习微调的指导。
★ 0 · 更新于 2026-06-30
使用verl库进行LLM的RLHF、GRPO和PPO强化学习训练
★ 650 · 更新于 2026-06-15
跨多个云平台运行机器学习工作负载并优化成本
★ 1 · 更新于 2026-03-24
从数据准备到模型部署编排 ML 工作流