serving-llms-vllm - 高性能大语言模型服务框架
用于部署生产级大语言模型的高性能服务框架,支持 OpenAI 兼容 API、模型量化与张量并行。
标签
更新于: 2026-09-22能力
典型输入
典型输出
该技能可以做什么
- 部署生产级 LLM API
- 运行离线批量推理
- 提供量化 LLM 服务
- 监控服务器性能指标
输入
- 大语言模型
- 输入文本提示词
- 服务器配置参数
- GPU 硬件资源
输出
- 兼容 OpenAI 的 API 服务
- 生成文本响应
- JSONL 结果文件
- Prometheus 指标端点
要求
- Linux 或 macOS 操作系统
- Python 依赖包 vllm、torch、transformers
- 受支持的 GPU 硬件
