vllm - 运行与排查 vLLM 推理服务器
在 Docker、Kubernetes 和 GPU 环境中部署、配置、服务、基准测试、调优并排查 vLLM 推理服务器。
标签
更新于: 2026-10-01能力
典型输入
典型输出
该技能可以做什么
- 使用 Docker 部署 vLLM
- 在 Kubernetes 上部署 vLLM
- 配置模型服务
- 调优 KV 缓存与批处理
- 提供 OpenAI 兼容 API
- 测试吞吐量与延迟
- 检查健康状态与指标
- 诊断 GPU 与启动故障
- 升级或回滚部署
- 验证推理交付
输入
- 部署目标
- vLLM 版本或镜像摘要
- 模型与版本
- 量化与并行设置
- GPU 清单
- 工作负载说明
- 基准测试数据集
- 服务器 URL
- 人工变更指令
输出
- 部署配置变更
- OpenAI 兼容 API 响应
- 健康与指标探测 JSON
- 基准测试指标与运行记录
- 升级或回滚状态
- 诊断摘要
要求
- vLLM 0.26.0 或固定版本的旧版本
- 受支持的 NVIDIA CUDA、AMD ROCm、Intel XPU 或 CPU 环境
- 适用时使用匹配的 GPU 驱动
- 健康脚本需要 Python 3.9 及以上
- 实时探测需要 HTTP(S) 访问
- 执行变更需要人工确认
