gguf-quantization - GGUF 模型量化高效推理
将模型转换为 GGUF 格式并进行量化以实现高效 CPU/GPU 推理
标签
更新于: 2026-06-30能力
典型输入
典型输出
该技能可以做什么
- 转换模型为 GGUF 格式
- 量化 GGUF 模型
- 运行模型推理
- 生成重要性矩阵
- 启动推理服务器
- 加载 GGUF 模型
输入
- HuggingFace 模型
- 量化类型
- 校准文本
- GGUF 模型文件
输出
- GGUF 模型文件
- 量化模型文件
- 模型推理输出
- 重要性矩阵文件
要求
- llama.cpp
- llama-cpp-python
- 兼容硬件
- C/C++ 编译器
