LogoClawIndex
案例技能关于
LogoClawIndex

thinkdial-reasoning-effort-control - ThinkDial:控制大语言模型推理力度

通过预算感知微调和自适应奖励塑形,使用高、中、低模式控制大语言模型的推理力度。

标签

更新于: 2026-10-01

能力

典型输入

典型输出

该技能可以做什么

  • 定义离散推理模式
  • 设置令牌预算
  • 执行预算感知监督微调
  • 运行两阶段强化学习
  • 按预算塑造奖励
  • 运行时切换推理模式

输入

  • 可训练的大语言模型
  • 训练数据集
  • 推理模式
  • 输入提示
  • 真实响应
  • 训练超参数

输出

  • 生成的响应
  • 训练损失
  • 奖励和损失指标
  • 更新后的模型参数

要求

  • 支持 PyTorch 的 Python 环境
  • 可训练的大语言模型实现
  • 文本生成接口
  • 对数概率接口

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
推理预算
令牌压缩
可控推理
预算感知训练
奖励塑形
定义离散推理模式
设置令牌预算
执行预算感知监督微调
运行两阶段强化学习
可训练的大语言模型
训练数据集
推理模式
生成的响应
训练损失
奖励和损失指标