LogoClawIndex
案例技能关于
LogoClawIndex

practitioner-guide-multi-turn-agentic-rl - 多轮智能体强化学习实践指南

通过优化环境复杂度、奖励信号和策略初始化,使用多轮强化学习训练LLM智能体。

标签

更新于: 2026-03-25

能力

典型输入

典型输出

该技能可以做什么

  • 配置环境复杂度
  • 设计训练课程
  • 实现密集奖励
  • 执行验证奖励
  • 使用SFT初始化策略
  • 运行PPO算法
  • 运行GRPO算法
  • 计算GAE优势
  • 在基准测试上评估

输入

  • 环境配置
  • 奖励信号定义
  • SFT演示数据
  • 计算预算
  • 单元测试
  • TextWorld环境
  • ALFWorld环境
  • SWE-Gym环境

输出

  • 训练好的智能体策略
  • 基准评估结果
  • 学习曲线
  • 智能体收敛状态

要求

  • Python框架veRL
  • 7B以上LLM(用于复杂任务)
  • PPO或GRPO算法支持
  • 1000以上计算单位预算

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
强化学习
智能体训练
多轮任务
策略优化
奖励工程
配置环境复杂度
设计训练课程
实现密集奖励
执行验证奖励
环境配置
奖励信号定义
SFT演示数据
训练好的智能体策略
基准评估结果
学习曲线