llama-cpp - llama.cpp 辅助本地LLM推理引擎
辅助本地LLM推理引擎,用于直接运行GGUF模型、加载LoRA适配器、基准测试和自定义模型服务
标签
更新于: 2026-03-10该技能可以做什么
- 运行GGUF推理
- 加载LoRA适配器
- 基准测试推理
- 启动API服务器
- 转换LoRA为GGUF
- 解析模型路径
- 生成嵌入向量
输入
- GGUF模型文件
- LoRA适配器
- Ollama模型名称
- 提示词文本
- 量化类型
输出
- 推理文本
- 时序统计
- API端点
- 转换后的GGUF模型
- 基准测试报告
要求
- 安装llama.cpp
- GGUF模型文件
- Apple Silicon支持
