unsloth-inference - 部署微调模型用于生产推理
使用优化内核、vLLM或SGLang部署微调模型进行生产推理
标签
更新于: 2026-02-15该技能可以做什么
- 加载微调模型
- 启用优化内核
- 合并LoRA权重
- 部署vLLM服务器
- 创建OpenAI兼容API
- 生成模型响应
输入
- 微调模型
- 分词器
- 输入提示
- 服务器配置
- LoRA适配器
输出
- 推理结果
- OpenAI兼容端点
- 服务模型文件
- API响应
要求
- unsloth库
- torch安装
- Python环境
- vLLM可选
- SGLang可选
