tensorrt-llm - NVIDIA TensorRT-LLM LLM推理优化器
在NVIDIA GPU上优化LLM推理,支持量化和多GPU扩展
标签
更新于: 2026-03-19能力
典型输入
典型输出
该技能可以做什么
- 优化LLM推理
- 生成文本
- 服务聊天完成
- 编译模型
- 量化模型
- 跨GPU扩展
输入
- LLM模型标识符
- 输入提示词
- 采样参数
- NVIDIA GPU硬件
输出
- 生成的文本
- 推理结果
- 模型编译输出
- 聊天完成响应
要求
- NVIDIA GPU (A100/H100/GB200)
- CUDA 13.0.0
- TensorRT 10.13.2
- Python 3.10-3.12
