unsloth-inference - 微调模型的优化推理部署使用内核优化、vLLM或SGLang部署微调模型进行生产推理标签更新于: 2026-02-15推理模型部署优化生产服务能力典型输入典型输出该技能可以做什么启用优化内核合并LoRA权重导出用于生产服务提供OpenAI兼容端点输入微调模型分词器LoRA权重输出优化推理模型合并模型文件API端点要求unsloth库PyTorchvLLM(可选)SGLang(可选)来源规范: SKILL.md