AI产品库

产品情报 / 开源大模型推理引擎

llama.cpp(ggml-org)Logollama.cpp

纯 C/C++ 的开源本地大模型推理引擎

官方目标是在各类硬件上以最小配置实现最先进的 LLM 与 VLM 推理:项目用纯 C/C++ 实现、不依赖额外运行时,支持 1.5–8 bit 量化与十余种计算后端,并提供 OpenAI 兼容的本地 API 服务与自带 Web UI。

深度介绍

llama.cpp详细介绍

🧩

从安装到跑模型:一条命令的事

官方给出的上手路径很短:用一行安装脚本(curl -LsSf https://llama.app/install.sh | sh)装好,然后 llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF 就能直接从 Hugging Face 拉模型并开始对话。想要接口服务,换成 llama serve 即可。除脚本安装外,官方也支持 Homebrew、Winget、Docker 镜像、releases 页的预编译二进制,以及从源码构建(文档里有独立的构建与安装章节)。对使用者来说,差别在于:脚本与包管理器最省事,Docker 适合放进已有容器流程,源码构建适合要指定后端或做二次开发的场景。

🔓

纯 C/C++、无依赖、MIT 许可

项目的官方目标是「用最小的配置,在广泛的硬件上实现最先进的 LLM 与 VLM 推理」,实现方式是纯 C/C++ 编写、不引入额外运行时依赖,底层建立在同组织的 ggml 库之上。仓库以 MIT 许可开源,2023 年 3 月创建,截至核验时约有 12.9 万 star 与 2.3 万 fork,最新语义化版本为 v0.4.1(2026 年 9 月 14 日),同时还有按构建号发布的 nightly。对要把它嵌进自己产品的人来说,MIT 与无依赖这两点意味着许可证摩擦小、打包体积可控,代价是需要自己维护运行环境与模型文件。

⚖️

量化:1.5 到 8 bit,还有 GGUF

官方明确支持 1.5-bit、2-bit、3-bit、4-bit、5-bit、6-bit 与 8-bit 整数量化,模型以 GGUF 格式分发;KV 缓存的数据类型同样可选(f16、bf16、q8_0、q4_0、q4_1、iq4_nl、q5_0、q5_1)。量化的直接收益是降低内存与显存占用、提升单位硬件的推理速度,代价是精度损失——位宽越低越明显,通常从 4-bit 起的 K 系列量化是本地部署的常见折中点。工程上值得记住的是两点:一是量化文件由社区与官方共同产出,选文件时看清位数与来源;二是长上下文场景下 KV 缓存量化能显著省显存,但要实测质量是否可接受。

🖥

后端覆盖:从 Apple Silicon 到国产加速卡

官方 README 列出的后端相当宽:CUDA(NVIDIA,使用自研 kernel)、HIP(AMD)、MUSA(摩尔线程)、Metal(Apple Silicon,配合 ARM NEON 与 Accelerate)、Vulkan、SYCL(Intel GPU)、OpenCL(Adreno GPU)、CANN(昇腾 NPU)、Hexagon(骁龙)、WebGPU、RPC(可跨机分配算力)、BLAS/BLIS、ZenDNN(AMD CPU)、IBM zDNN、VirtGPU 等,OpenVINO 支持标注为进行中。x86 上有 AVX/AVX2/AVX512/AMX 优化,RISC-V 侧有 RVV、ZVFH、ZFH 等扩展支持。当模型大于可用显存时,CPU+GPU 混合推理可以只加速一部分层,让「跑得动」先于「跑得快」。

🌐

llama-server:OpenAI 与 Anthropic 双兼容

llama-server 提供 OpenAI 兼容的 /v1/chat/completions、/v1/completions、/v1/responses 与 /v1/embeddings,另外还提供 Anthropic Messages 风格的 /v1/messages,因此现有客户端通常只需改 base_url 与 Key 就能接上本地模型。能力面比单纯的对话接口宽:连续批处理与并行解码支持多用户,多模态输入支持图片、音频与视频(本地文件需配 --media-path),输出可用 JSON Schema 或 GBNF 语法约束,函数调用需要 --jinja,另有推测解码、重排端点、实时推理控制(可提前结束思考段)以及 Prometheus 指标接口。服务端自带 Web UI,也可以指定 --path 托管自己的静态页面。

🧭

路由模式:一个进程管多个模型

不指定模型直接启动 llama-server,它会进入路由模式:主进程作为路由器,按请求里的 model 字段把请求转发给对应实例,并按需加载或卸载模型,也可用 --no-models-autoload 关掉自动加载。模型来源有三种——llama.cpp 的缓存目录、--models-dir 指定的本地目录,以及 .ini 格式的模型预设文件。预设允许给每个模型写独立参数(上下文长度、n-gpu-layers、是否启用 jinja 等),并支持 load-on-startup 与卸载超时等路由器专属选项。对自建服务的团队,这意味着不必为每个模型起一套独立容器与端口。

💻

一套二进制,覆盖笔记本到服务器

官方站点把支持范围写得很直白:「从你的笔记本到集群」,并逐项列出 Apple Silicon、M 系列 Pro/Max/Ultra 芯片、RTX 5090/4090/3090、CPU、Jetson、H100、B200、MI300、T4、DGX Spark、Intel Arc 等。关键在于同一套二进制、同一批模型、同一套手写 kernel——不必为不同硬件维护不同分支。实际选型时,显存与内存带宽仍是决定因素:能整层放进显存的模型速度远好于混合推理,而统一内存的 Mac 在超大模型上反而更从容。文档另有 Docker、Android、多 GPU 与性能调优等专门章节。

🤖

和本地编码 Agent 配合,以及内置工具

官方站点给出一条与本地编码 Agent 协作的路径:先 llama serve 起服务,装上 pi-llama 插件,再启动 Pi,Agent 会自动发现本地模型,全程不需要配置 API Key,请求不离开本机。服务端还有一组实验性内置工具(读文件、通配搜索、文本搜索、执行 shell 命令、写文件、编辑文件等),可用 --tools 开启,并能通过 --tools-runtime 把它们放进 Docker 或 Podman 容器里隔离运行。官方对这些能力的定调是「不要在不可信环境里开启」,并说明开启后 CORS 默认收紧到 localhost——涉及本机文件与命令执行,权限边界需要自己把住。

产品特点

核心功能与独有价值

01

1.5 到 8 bit 量化与 GGUF 格式

官方明确支持 1.5-bit 至 8-bit 的整数量化,模型统一用 GGUF 分发,KV 缓存数据类型也可单独指定。量化让同一台机器跑更大的模型,代价是精度,通常从 4-bit 系列量化开始试。

02

一句命令直接从 Hugging Face 跑模型

llama cli -hf 与 llama serve -hf 可以直接从 Hugging Face 拉取 GGUF 并运行或起服务,不用先手动下载再指定路径;多模态模型的投影文件也会自动一起下载。

03

十余种后端与 CPU+GPU 混合推理

CUDA、HIP、MUSA、Metal、Vulkan、SYCL、OpenCL、CANN、Hexagon、WebGPU、RPC 等后端覆盖 NVIDIA、AMD、Apple、Intel、昇腾与骁龙等硬件;模型超过显存时可用混合推理只加速部分层。

04

路由模式与双协议兼容接口

不指定模型启动 llama-server 即进入路由模式,按请求里的模型名动态加载与卸载实例,支持本地目录与 .ini 预设;接口同时兼容 OpenAI 与 Anthropic 两种调用风格。

最近动态

重要更新

官方主页迁到 llama.app,含模型与文档页

截至 2026 年 9 月核验,仓库 README 的上手引导指向 llama.app,站点标题为「llama.cpp 的官方主页」,提供安装脚本、模型介绍页与文档入口;仓库本身仍是最完整的源码与 issue 入口。

版本节奏:语义化版本与 nightly 并行

官方 releases 同时提供语义化版本(最新 v0.4.1,2026 年 9 月 14 日发布)与按构建号发布的 nightly。要跟进新模型支持可以选 nightly,要稳定则跟语义化版本,两者在 README 的徽章上都有入口。

服务端增加 Anthropic 兼容与实时控制

llama-server 的接口在 OpenAI 兼容之外增加了 Anthropic Messages 风格的 /v1/messages 与 token 计数端点,并引入实时推理控制:在流式生成过程中可对指定请求提前结束思考段,便于交互式产品控制延迟。

路由器模式与实验性内置工具

服务端支持不指定模型启动的路由模式,按模型名动态加载卸载,并可用 .ini 预设为每个模型单独配置参数;另有实验性的内置工具集(文件读写、搜索、执行命令),支持放进 Docker 或 Podman 容器隔离,官方提示不要在不可信环境开启。

产品总结

llama.cpp 是用纯 C/C++ 写的开源大模型推理引擎,底层建立在同组织的 ggml 库之上,目标是「用最小的配置,在广泛的硬件上实现最先进的 LLM 与 VLM 推理」。项目以 MIT 许可开源,2023 年 3 月创建,截至 2026 年 9 月核验约有 12.9 万 star、2.3 万 fork,最新语义化版本为 v0.4.1(2026 年 9 月 14 日),同时提供按构建号发布的 nightly。官方主页是 llama.app,仓库 README 的上手引导也指向它;安装方式包括一键脚本、Homebrew、Winget、Docker 镜像、releases 预编译二进制与源码构建。 它最被称道的两点是量化与后端覆盖。量化方面支持 1.5-bit 到 8-bit 的整数量化,模型以 GGUF 格式分发,KV 缓存的数据类型也能单独指定(f16、bf16、q8_0、q4 系列等),让同一台机器跑更大的模型;后端方面覆盖 CUDA、HIP、MUSA、Metal、Vulkan、SYCL、OpenCL、CANN、Hexagon、WebGPU、RPC、BLIS/BLAS、ZenDNN、IBM zDNN 等,官方站点把支持范围概括为「从你的笔记本到集群」,并逐项列出 Apple Silicon、RTX 5090/4090、H100、B200、MI300、Jetson、DGX Spark、Intel Arc 等硬件。模型大于显存时,CPU+GPU 混合推理可以只加速一部分层。 工具链上,llama cli 用于直接对话(可用 -hf 从 Hugging Face 拉模型),llama serve 起本地 HTTP 服务:接口兼容 OpenAI 的 chat/completions、completions、responses 与 embeddings,另提供 Anthropic Messages 风格的接口,并支持连续批处理、并行解码、多模态输入(图片、音频、视频)、JSON Schema 与 GBNF 语法约束输出、函数调用、推测解码、重排端点与 Prometheus 指标,服务端自带 Web UI。不指定模型启动时进入路由模式,可按请求中的模型名动态加载与卸载,模型来源支持缓存目录、本地目录与 .ini 预设。 上手前需要注意:量化位宽越低越省资源,但精度损失需要实测,长上下文还会放大 KV 缓存的显存占用;多模态的本地文件需要配置 --media-path;函数调用依赖 --jinja 且部分模型需要指定合适的对话模板;服务端的内置工具能读写文件与执行命令,官方明确提示不要在不可信环境开启。此外,llama.cpp 面向的是自备硬件的本地或内网部署,官方不提供托管推理服务,模型下载、版本跟进与安全边界都需要自行维护。

产品类型
开源大模型推理引擎
支持平台
命令行(llama cli) / llama-server HTTP 服务 / OpenAI 兼容 API / Anthropic 兼容 API / 自带 Web UI / GGUF 模型格式 / Docker 镜像 / 多后端(CPU / CUDA / Metal /
资费模式
开源免费(MIT 许可);成本只来自自备硬件,官方不提供托管推理服务。

核验信息

参考文章与数据来源

本页事实来自 llama.cpp 官方渠道:GitHub 仓库 README(项目目标、纯 C/C++ 与无依赖表述、1.5–8 bit 量化、后端清单与 CPU+GPU 混合推理、llama cli 与 llama serve 的上手命令、MIT 许可与生态依赖)、官方主页 llama.app(「官方主页」定位、安装脚本、硬件清单、模型与文档页)、官方文档(安装、构建、多 GPU、Docker 章节)与 llama-server 文档(OpenAI 兼容与 Anthropic 兼容接口、连续批处理、多模态、JSON Schema 与 GBNF、函数调用、推测解码、重排与指标端点、路由模式与模型预设、实验性内置工具)。版本号、star 数与接口细节核验于 2026 年 9 月 22 日,变化较快,请以官方最新文档为准。

  1. 其他llama.cpp 官方仓库
  2. 官网官方主页 llama.app
  3. 官方文档官方文档入口
  4. 官方文档官方模型介绍页
  5. 官方文档官方文档 · 安装说明
  6. 官方文档官方文档 · 构建指南
  7. 官方文档官方文档 · llama-server REST API
  8. 官方文档官方文档 · 多 GPU 使用

用户体验调查

llama.cpp介绍页面对您是否有帮助?