unsloth-inference - 使用Unsloth部署微调模型进行生产推理
使用优化内核和服务引擎部署微调模型进行生产推理
标签
更新于: 2026-02-14能力
典型输入
典型输出
该技能可以做什么
- 加载微调模型
- 加载分词器
- 启用优化内核
- 生成文本响应
- 选择导出方法
- 合并LoRA权重
- 启动vLLM服务器
- 创建OpenAI兼容API
输入
- 微调模型文件
- 分词器
- LoRA适配器
- 基础模型
- vLLM配置
- SGLang配置
- OpenAI API规范
输出
- 优化推理模型
- 合并模型文件
- vLLM服务器端点
- OpenAI兼容API
- 文本生成响应
- 模型服务端点
要求
- 已安装Unsloth库
- 已安装PyTorch
- vLLM(生产环境可选)
- SGLang(生产环境可选)
- 具有足够显存的GPU
- 微调模型文件可用
