thinkdial-reasoning-effort-control - ThinkDial:控制大语言模型推理力度推理预算令牌压缩可控推理预算感知训练★ 6 · 更新于 2026-10-01通过预算感知微调和自适应奖励塑形,使用高、中、低模式控制大语言模型的推理力度。⚙ 定义离散推理模式⚙ 设置令牌预算⚙ 执行预算感知监督微调