serving-llms-vllm - 高性能大语言模型服务框架vLLM推理服务PagedAttention连续批处理★ 0 · 更新于 2026-09-22用于部署生产级大语言模型的高性能服务框架,支持 OpenAI 兼容 API、模型量化与张量并行。⚙ 部署生产级 LLM API⚙ 运行离线批量推理⚙ 提供量化 LLM 服务
tensorrt-llm - 使用 TensorRT-LLM 优化 NVIDIA GPU 上的大语言模型推理推理服务TensorRT-LLMNVIDIA推理优化★ 0 · 更新于 2026-09-09在 NVIDIA GPU 上通过量化、动态批处理与多 GPU 扩展优化大语言模型推理性能。⚙ 根据提示词生成文本响应⚙ 通过 HTTP API 提供模型服务⚙ 将模型量化为低精度格式