★ 22 · 更新于 2026-10-03
使用 PufferLib 通过并行向量化环境、原生多智能体支持、自定义 PufferEnv 任务和环境集成训练强化学习智能体。
浏览使用该输入的技能列表。
★ 22 · 更新于 2026-10-03
使用 PufferLib 通过并行向量化环境、原生多智能体支持、自定义 PufferEnv 任务和环境集成训练强化学习智能体。
★ 1 · 更新于 2026-10-03
提供使用 TRL、定制奖励函数和任务特定训练流程实现 GRPO 强化学习微调的指导。
★ 85 · 更新于 2026-09-28
使用 JAX 或 PyTorch 微调和服务 Physical Intelligence OpenPI 模型,用于 ALOHA、DROID 和 LIBERO 环境中的机器人策略推理。
★ 0 · 更新于 2026-09-24
提供大语言模型后训练的方法与工作流,涵盖 SFT、DPO、PPO、GRPO 及奖励模型训练。
★ 1,182 · 更新于 2026-02-18
为Numerai智能体训练管道添加新模型类型以进行训练和评估
★ 22 · 更新于 2026-02-15
用于数据集设计、模型微调、评估和部署的算法与模型开发技能