sglang - 具备RadixAttention前缀缓存的高性能LLM服务框架
使用RadixAttention前缀缓存为LLM与VLM提供结构化生成与高性能推理服务。
标签
更新于: 2026-09-24能力
典型输入
典型输出
该技能可以做什么
- 提供LLM与VLM推理服务
- 使用RadixAttention自动缓存前缀
- 生成结构化JSON输出
- 使用正则表达式约束生成
- 使用语法约束生成
- 执行函数调用智能体工作流
- 处理多模态图像输入
- 运行推测解码
- 执行批量推理
输入
- 模型路径
- 用户提示词与查询
- JSON Schema
- 正则表达式模式
- EBNF语法定义
- 工具定义
- 图像文件路径
输出
- 生成的文本响应
- 结构化JSON数据
- 正则约束文本
- 工具调用请求
- OpenAI API服务响应
要求
- Python环境
- PyTorch库
- Transformers库
- 兼容CUDA的GPU
