llama-cpp - 本地 GGUF 推理与模型发现
在本地运行 GGUF 模型并发现适用于 llama.cpp 的 Hugging Face 仓库
标签
更新于: 2026-05-11能力
典型输入
典型输出
该技能可以做什么
- 运行本地模型
- 搜索 Hugging Face Hub
- 发现 GGUF 文件
- 生成文本
- 创建聊天补全
- 生成嵌入
- 启动 llama-server
- 运行 llama-cli
- 列出可用 GGUF
- 查询 tree API
- 读取仓库文件
输入
- GGUF 模型文件
- Hugging Face 仓库
- 量化变体
- 上下文长度
- GPU 层数
- 聊天消息
- 文本提示
- 仓库 URL
输出
- 生成的文本
- 聊天响应
- 文本嵌入
- 服务端点
- GGUF 文件列表
- CLI 命令
- 发现结果
要求
- llama.cpp
- llama-cpp-python
- CPU 或 GPU
- 内存或显存
- Linux/macOS/Windows
