LogoClawIndex
案例技能关于
LogoClawIndex

tensorrt-llm - TensorRT-LLM LLM推理优化

使用 NVIDIA TensorRT 优化 LLM 推理,在 NVIDIA GPU 上实现高吞吐、低延迟的生产部署。

标签

更新于: 2026-03-19
推理服务TensorRT-LLMNVIDIA推理优化高吞吐低延迟生产环境FP8INT4多 GPULLM

能力

优化 LLM 推理使用 TensorRT 编译模型通过 HTTP API 服务模型从提示词生成文本

典型输入

LLM 模型输入提示词采样参数

典型输出

生成文本推理服务器API 响应

该技能可以做什么

  • 优化 LLM 推理
  • 使用 TensorRT 编译模型
  • 通过 HTTP API 服务模型
  • 从提示词生成文本
  • 配置采样参数
  • 跨多 GPU 部署
  • 对模型应用量化
  • 管理批处理请求
  • 启用动态批处理
  • 使用张量并行
  • 使用流水线并行

输入

  • LLM 模型
  • 输入提示词
  • 采样参数
  • GPU 设备
  • 模型权重

输出

  • 生成文本
  • 推理服务器
  • API 响应
  • 编译后的模型

要求

  • NVIDIA GPU (A100/H100/GB200)
  • CUDA 13.0.0+
  • TensorRT 10.13.2+
  • Python 3.10-3.12
  • tensorrt-llm 包

来源

  • 规范: SKILL.md

ClawIndex

OpenClaw Skills 与 Use Case 索引

ClawIndex 是一个生态驱动的 OpenClaw Skills 与真实 Use Case 索引站。

索引

Skills·
Cases

Meta

关于·
声明·
邮箱·
GitHub
© 2026 ClawIndex 保留所有权利。