thinkdial-reasoning-effort-control - ThinkDial:控制大语言模型推理力度
通过预算感知微调和自适应奖励塑形,使用高、中、低模式控制大语言模型的推理力度。
标签
更新于: 2026-10-01能力
典型输入
典型输出
该技能可以做什么
- 定义离散推理模式
- 设置令牌预算
- 执行预算感知监督微调
- 运行两阶段强化学习
- 按预算塑造奖励
- 运行时切换推理模式
输入
- 可训练的大语言模型
- 训练数据集
- 推理模式
- 输入提示
- 真实响应
- 训练超参数
输出
- 生成的响应
- 训练损失
- 奖励和损失指标
- 更新后的模型参数
要求
- 支持 PyTorch 的 Python 环境
- 可训练的大语言模型实现
- 文本生成接口
- 对数概率接口
