LogoClawIndex
案例技能关于
LogoClawIndex

vllm - 运行与排查 vLLM 推理服务器

在 Docker、Kubernetes 和 GPU 环境中部署、配置、服务、基准测试、调优并排查 vLLM 推理服务器。

标签

更新于: 2026-10-01

能力

典型输入

典型输出

该技能可以做什么

  • 使用 Docker 部署 vLLM
  • 在 Kubernetes 上部署 vLLM
  • 配置模型服务
  • 调优 KV 缓存与批处理
  • 提供 OpenAI 兼容 API
  • 测试吞吐量与延迟
  • 检查健康状态与指标
  • 诊断 GPU 与启动故障
  • 升级或回滚部署
  • 验证推理交付

输入

  • 部署目标
  • vLLM 版本或镜像摘要
  • 模型与版本
  • 量化与并行设置
  • GPU 清单
  • 工作负载说明
  • 基准测试数据集
  • 服务器 URL
  • 人工变更指令

输出

  • 部署配置变更
  • OpenAI 兼容 API 响应
  • 健康与指标探测 JSON
  • 基准测试指标与运行记录
  • 升级或回滚状态
  • 诊断摘要

要求

  • vLLM 0.26.0 或固定版本的旧版本
  • 受支持的 NVIDIA CUDA、AMD ROCm、Intel XPU 或 CPU 环境
  • 适用时使用匹配的 GPU 驱动
  • 健康脚本需要 Python 3.9 及以上
  • 实时探测需要 HTTP(S) 访问
  • 执行变更需要人工确认

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。
vLLM
推理服务
Docker
Kubernetes
OpenAI API
基准测试
GPU 运维
连续批处理
量化
故障排查
使用 Docker 部署 vLLM
在 Kubernetes 上部署 vLLM
配置模型服务
调优 KV 缓存与批处理
部署目标
vLLM 版本或镜像摘要
模型与版本
部署配置变更
OpenAI 兼容 API 响应
健康与指标探测 JSON