LogoClawIndex
案例技能关于
LogoClawIndex

alterlab-pufferlib - 使用 PufferLib 扩展强化学习训练

使用 PufferLib 通过并行向量化环境、原生多智能体支持、自定义 PufferEnv 任务和环境集成训练强化学习智能体。

标签

更新于: 2026-10-03

能力

典型输入

典型输出

该技能可以做什么

  • 训练 PPO 智能体
  • 创建 PufferEnv 任务
  • 向量化环境模拟
  • 集成 Gymnasium 环境
  • 集成 PettingZoo 环境
  • 开发自定义策略
  • 扩展多智能体训练

输入

  • 强化学习环境
  • 训练配置
  • 策略架构
  • 环境集成设置
  • 检查点路径

输出

  • 训练后的策略
  • 训练指标
  • 环境实现
  • 训练检查点
  • 训练状态

要求

  • 本地 Python 环境
  • uv 命令
  • pufferlib Python 包
  • PufferLib 3.0.x
  • 可选 GPU
  • 无需 API 密钥

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
强化学习
PufferLib
PPO
向量化环境
多智能体学习
并行训练
Gymnasium
PettingZoo
训练 PPO 智能体
创建 PufferEnv 任务
向量化环境模拟
集成 Gymnasium 环境
强化学习环境
训练配置
策略架构
训练后的策略
训练指标
环境实现