LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

带有该标签的 Skills:强化学习

浏览带有该标签的技能列表。

  • fine-tuning-with-trl - 使用 TRL 进行大语言模型后训练与偏好对齐
    后训练TRL强化学习微调

    ★ 0 · 更新于 2026-09-24

    提供大语言模型后训练的方法与工作流,涵盖 SFT、DPO、PPO、GRPO 及奖励模型训练。

    ⚙ 执行监督微调⚙ 训练奖励模型⚙ 使用 DPO 对齐模型
  • slime-rl-training - 使用 slime 框架进行大模型 RL 后训练。
    强化学习Megatron-LMSGLangGRPO

    ★ 0 · 更新于 2026-09-24

    提供使用集成 Megatron-LM 与 SGLang 的 slime 框架进行大模型强化学习后训练的指导与工作流。

    ⚙ 执行标准 GRPO 训练⚙ 运行异步强化学习训练⚙ 进行多轮 Agent 训练
  • drpo-llm-rl - 用于稳定大模型强化学习的 DRPO 优化
    DRPO大模型强化学习强化学习策略优化

    ★ 3 · 更新于 2026-09-15

    通过平滑的优势加权二次正则项替代硬信任域掩码,以稳定大语言模型的强化学习后训练。

    ⚙ 评估当前强化学习训练设置⚙ 设计 DRPO 二次正则化器⚙ 实现平滑策略正则化
  • verl-rl-training - 大语言模型强化学习训练库
    强化学习RLHFGRPOPPO

    ★ 602 · 更新于 2026-06-30

    提供使用 verl 库对大语言模型进行强化学习训练的指导

    ⚙ 使用 RLHF 训练模型⚙ 使用 GRPO 训练模型⚙ 使用 PPO 训练模型
  • verl-rl-training - 使用Verl的大语言模型强化学习训练
    强化学习RLHF后训练分布式训练

    ★ 0 · 更新于 2026-06-30

    使用verl通过PPO、GRPO等强化学习算法大规模训练大语言模型

    ⚙ 使用PPO训练模型⚙ 使用GRPO训练模型⚙ 配置强化学习算法
  • verl-rl-training - 使用verl库训练大语言模型
    强化学习RLHF模型训练分布式计算

    ★ 1 · 更新于 2026-06-30

    支持多种算法和后端的大语言模型灵活强化学习训练库

    ⚙ 使用GRPO算法训练LLM⚙ 使用PPO算法训练LLM⚙ 使用RLOO算法训练LLM
  • verl-rl-training - 使用verl进行LLM强化学习训练
    强化学习RLHFGRPOPPO

    ★ 0 · 更新于 2026-06-30

    使用verl库进行LLM的RLHF、GRPO和PPO强化学习训练

    ⚙ 训练LLM⚙ 配置算法⚙ 准备数据集
  • verl-rl-training - verl LLM强化学习训练框架
    强化学习RLHFGRPOPPO

    ★ 1 · 更新于 2026-06-30

    大语言模型强化学习训练库

    ⚙ 训练模型⚙ 执行rollout⚙ 计算奖励
  • verl-rl-training - 使用 verl 进行 LLM 强化学习训练
    大语言模型强化学习训练分布式系统

    ★ 0 · 更新于 2026-06-30

    使用 verl 库通过强化学习算法训练大语言模型

    ⚙ 实施 RLHF⚙ 配置 GRPO⚙ 运行 PPO
  • miles-rl-training - 企业级强化学习训练框架
    强化学习MoEFP8INT4

    ★ 602 · 更新于 2026-05-11

    面向大规模MoE模型的企业级强化学习训练框架,支持FP8/INT4精度训练

    ⚙ 训练MoE模型⚙ 配置FP8训练⚙ 配置INT4训练