★ 0 · 更新于 2026-09-22
用于部署生产级大语言模型的高性能服务框架,支持 OpenAI 兼容 API、模型量化与张量并行。
浏览带有该标签的技能列表。
★ 0 · 更新于 2026-09-22
用于部署生产级大语言模型的高性能服务框架,支持 OpenAI 兼容 API、模型量化与张量并行。
★ 0 · 更新于 2026-09-09
在 NVIDIA GPU 上通过量化、动态批处理与多 GPU 扩展优化大语言模型推理性能。
★ 0 · 更新于 2026-09-09
基于 NVIDIA GPU 提供模型量化、动态批处理与多 GPU 并行优化以加速大模型推理。
★ 2 · 更新于 2026-03-19
使用 NVIDIA TensorRT 优化 LLM 推理,在 NVIDIA GPU 上实现高吞吐、低延迟的生产部署。