tensorrt-llm - TensorRT-LLM LLM推理优化
使用 NVIDIA TensorRT 优化 LLM 推理,在 NVIDIA GPU 上实现高吞吐、低延迟的生产部署。
标签
更新于: 2026-03-19该技能可以做什么
- 优化 LLM 推理
- 使用 TensorRT 编译模型
- 通过 HTTP API 服务模型
- 从提示词生成文本
- 配置采样参数
- 跨多 GPU 部署
- 对模型应用量化
- 管理批处理请求
- 启用动态批处理
- 使用张量并行
- 使用流水线并行
输入
- LLM 模型
- 输入提示词
- 采样参数
- GPU 设备
- 模型权重
输出
- 生成文本
- 推理服务器
- API 响应
- 编译后的模型
要求
- NVIDIA GPU (A100/H100/GB200)
- CUDA 13.0.0+
- TensorRT 10.13.2+
- Python 3.10-3.12
- tensorrt-llm 包
