llama-cpp - 本地 GGUF 模型推理
本地运行 GGUF 模型并从 Hugging Face Hub 发现模型
标签
更新于: 2026-05-11能力
典型输入
典型输出
该技能可以做什么
- 发现 Hugging Face 仓库
- 下载 GGUF 文件
- 本地运行 GGUF 模型
- 生成 llama-server 命令
- 生成 llama-cli 命令
- 生成文本
- 生成聊天回复
- 创建嵌入向量
- 选择量化格式
- 列出 GGUF 文件
输入
- Hugging Face 仓库 ID
- GGUF 模型文件
- 量化标签
- 上下文窗口大小
- 模型 URL
输出
- 文本回复
- 聊天补全
- 嵌入向量
- 模型文件列表
- 服务器命令
- HTTP 端点
要求
- llama.cpp 安装
- llama-cpp-python>=0.2.0
- Linux/macOS/Windows
- CPU 或 GPU
