sglang - 具备RadixAttention前缀缓存的高性能LLM服务框架推理服务SGLang结构化生成RadixAttention★ 0 · 更新于 2026-09-24使用RadixAttention前缀缓存为LLM与VLM提供结构化生成与高性能推理服务。⚙ 提供LLM与VLM推理服务⚙ 使用RadixAttention自动缓存前缀⚙ 生成结构化JSON输出
unsloth-inference - 使用Unsloth部署微调模型进行生产推理模型推理模型部署vllmsglang★ 602 · 更新于 2026-02-14使用优化内核和服务引擎部署微调模型进行生产推理⚙ 加载微调模型⚙ 加载分词器⚙ 启用优化内核