deploy-kimi-k26-on-rtx-pro-6000 - 在 8 张 RTX PRO 6000 GPU 上部署 Kimi-K2.6
在 8 张 RTX PRO 6000 Blackwell GPU 上使用 Docker 和 vLLM 或 SGLang 部署并提供 INT4 QAT 或 NVFP4 量化的 Kimi-K2.6 服务。
标签
更新于: 2026-10-05能力
典型输入
典型输出
该技能可以做什么
- 验证 GPU 和主机状态
- 选择模型量化方式
- 选择推理引擎
- 选择 MoE 后端
- 选择 KV 缓存类型
- 下载模型权重
- 运行 Docker 推理服务
- 提供 OpenAI 兼容 API
- 配置 systemd 服务
- 排查 GPU 服务故障
输入
- GPU 硬件信息
- 量化方式选择
- 推理引擎选择
- MoE 后端选择
- KV 缓存类型选择
- Hugging Face 模型检查点
- Hugging Face 缓存路径
- 认证代理配置
输出
- 已下载的模型权重
- Docker 推理服务
- 30000 端口上的 OpenAI 兼容 API
- kimi-k26 systemd 服务
- 部署环境文件
- 服务及故障排查状态
要求
- Linux 服务器
- 8 张 NVIDIA RTX PRO 6000 Blackwell GPU
- 570 或更高版本的 NVIDIA 驱动
- 开放式 NVIDIA 内核模块
- Docker
- 支持 CDI 的 NVIDIA Container Toolkit
- 运行中的 nvidia-persistenced
- 约 650 GB 可用本地 NVMe 存储
- 模型文件和 Docker 镜像访问权限
