★ 0 · 更新于 2026-09-24
使用RadixAttention前缀缓存为LLM与VLM提供结构化生成与高性能推理服务。
浏览使用该输入的技能列表。
★ 0 · 更新于 2026-09-24
使用RadixAttention前缀缓存为LLM与VLM提供结构化生成与高性能推理服务。
★ 92 · 更新于 2026-09-09
运行本地 GGUF 推理、选择量化方案,并在 Hugging Face 上发现兼容 llama.cpp 的模型和文件。
★ 0 · 更新于 2026-05-11
适配并调试Hugging Face或本地模型在昇腾NPU上运行vLLM
★ 0 · 更新于 2026-05-11
适配和调试模型在Ascend NPU上运行vLLM
★ 5 · 更新于 2026-05-11
适配Hugging Face或本地模型在vllm-ascend上运行,代码改动最小化
★ 57 · 更新于 2026-05-11
为 vLLM 在 Ascend NPU 上适配和调试模型
★ 602 · 更新于 2026-05-11
为机器学习模型生成部署产物,包括API、容器化、监控和A/B测试基础设施
★ 18 · 更新于 2026-03-23
通过OOM重试和自动卸载管理多服务GPU显存共享