跳到主要内容

llama.cpp 速查表

llama.cpp 是一个高性能的 C/C++ 本地 LLM 推理引擎,支持 GGUF 格式模型。它提供 `llama-cli`(命令行推理)和 `llama-server`(HTTP 服务器,兼容 OpenAI API)两种使用方式,支持 CPU/GPU/Metal 推理和模型量化。

更新: 2026-07-20·25 条命令

快速开始

``bash # 下载 GGUF 模型 huggingface-cli download bartowski/Llama-3.2-3B-Instruct-GGUF --include 'Q4_K_M/*' --local-dir ./models

# 命令行推理 llama-cli -m ./models/Llama-3.2-3B-Instruct-Q4_K_M.gguf -p "你好,最近怎么样?"

# HTTP 服务模式(兼容 OpenAI API) llama-server -m ./models/Llama-3.2-3B-Instruct-Q4_K_M.gguf --port 8080

# 通过 API 调用(另一个终端) curl -s http://localhost:8080/v1/chat/completions \ -d '{"model":"model","messages":[{"role":"user","content":"你好"}]}' `

CLI 推理(llama-cli)

llama-cli 用于终端直接推理。核心参数:-m(模型文件)、-p(提示词)、-n(最大 token 数)、--temp(温度)、-ngl(GPU 层数)、-t(线程数)。加 --no-display-prompt 只输出生成文本。

HTTP 服务器(llama-server)

llama-server 提供 OpenAI 兼容 API。支持聊天补全(/v1/chat/completions)、文本补全(/v1/completions)、嵌入向量(/v1/embeddings)、分词、模型管理等端点。

模型量化

llama-quantize 在不同 GGUF 量化等级间转换。典型用法:llama-quantize input.gguf output.gguf Q4_K_M。常用类型:Q4_0(最快)、Q4_K_M(推荐平衡)、Q5_K_M(更高质量)、Q8_0(近乎无损)。

嵌入向量

llama.cpp 支持 RAG 流水线的文本嵌入。服务器模式加 --embeddings 启用嵌入端点,或用 llama-embedding 命令行工具单独生成。

GPU 加速

-ngl N 控制 GPU 卸载层数。-ngl 99` 卸载全部层。Apple Silicon 自动使用 Metal,NVIDIA 使用 CUDA,AMD 使用 Vulkan 或 HIP。

启动模式(11)

命令难度
llama-cli --help
显示 llama.cpp CLI 帮助信息
基础
llama-cli -m
指定模型文件路径(GGUF 格式)
基础
llama-cli -p
指定输入提示词
基础
llama-cli -f
从文件读取提示词
基础
llama-cli -n
设置最大生成 token 数
基础
llama-cli -t
设置线程数(CPU 推理)
中级
llama-cli --temp
设置温度参数(0-2)
中级
llama-cli --top-p
设置 top-p 采样参数
中级
llama-cli --ctx-size
设置上下文窗口大小
中级
llama-cli -ngl
指定 GPU 卸载层数(GPU 加速)
中级
llama-cli --no-display-prompt
输出只包含生成的文本(不含提示词)
基础

ai-server(8)

命令难度
llama-server --help
显示 HTTP 服务器帮助
基础
llama-server -m
以 HTTP 服务器模式启动模型
中级
llama-server --port
指定服务器监听端口
基础
llama-server --host
指定绑定的主机地址
中级
llama-server -ngl
服务器模式下 GPU 卸载
中级
llama-server --embeddings
启用嵌入向量端点
高级
llama-server --chat-template
指定聊天模板文件
高级
curl localhost:8080/v1/chat/completions
向 llama-server 发送 OpenAI 兼容请求
中级

ai-model(3)

命令难度
llama-cli --hf-token
使用 HuggingFace Token 下载模型
中级
llama-cli --hf
从 HuggingFace 直接加载模型
中级
llama-quantize
量化模型到指定精度
高级

ai-eval(1)

命令难度
llama-perplexity -m
评估模型的困惑度
高级

ai-embedding(2)

命令难度
llama-embedding
生成文本嵌入向量
中级
curl -X POST http://localhost:8080/v1/embeddings
通过 API 获取嵌入向量
中级

常见问题

本速查表数据整理自各工具官方文档。最后更新: 2026-07-20。