★ 0 · 更新于 2026-09-22
用于部署生产级大语言模型的高性能服务框架,支持 OpenAI 兼容 API、模型量化与张量并行。
浏览带有该标签的技能列表。
★ 0 · 更新于 2026-09-22
用于部署生产级大语言模型的高性能服务框架,支持 OpenAI 兼容 API、模型量化与张量并行。
★ 0 · 更新于 2026-06-30
将模型转换为 GGUF 格式并进行量化以实现高效 CPU/GPU 推理
★ 0 · 更新于 2026-05-11
在本地运行 GGUF 模型并发现适用于 llama.cpp 的 Hugging Face 仓库
★ 17 · 更新于 2026-05-11
本地GGUF推理、量化选择和Hugging Face Hub模型发现
★ 1 · 更新于 2026-05-11
本地运行 GGUF 模型并从 Hugging Face Hub 发现模型