llama-cpp - 本地GGUF推理与HF模型发现
本地GGUF推理、量化选择和Hugging Face Hub模型发现
标签
更新于: 2026-05-11能力
典型输入
典型输出
该技能可以做什么
- 运行本地模型
- 搜索Hugging Face Hub
- 查找GGUF文件
- 构建llama-server命令
- 构建llama-cli命令
- 列举GGUF文件
- 选择量化变体
- 加载GGUF模型
- 生成文本
- 创建聊天补全
- 流式响应
- 生成嵌入向量
- 提取文件元数据
输入
- Hugging Face仓库
- GGUF文件
- 量化变体
- 硬件配置
- 提示文本
- 聊天消息
输出
- 生成文本
- 聊天补全
- 嵌入向量
- llama-server命令
- llama-cli命令
- GGUF文件列表
- 文件元数据
要求
- llama-cpp-python >= 0.2.0
- Linux或macOS或Windows
- 可选CUDA/ROCm/Metal
