LogoClawIndex
案例技能关于
LogoClawIndex

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。

带有该标签的 Skills:策略优化

浏览带有该标签的技能列表。

  • drpo-llm-rl - 用于稳定大模型强化学习的 DRPO 优化
    DRPO大模型强化学习强化学习策略优化

    更新于 2026-09-15

    通过平滑的优势加权二次正则项替代硬信任域掩码,以稳定大语言模型的强化学习后训练。

    ⚙ 评估当前强化学习训练设置⚙ 设计 DRPO 二次正则化器⚙ 实现平滑策略正则化