推理部署#量化#CPU 推理#边缘设备#GGUF

llama.cpp · 纯 C/C++ 大模型推理引擎

让大模型跑在 CPU/手机/树莓派上的量化推理引擎,GGUF 格式发起者

128k stars 23k forksC++ MIT 最近提交 2026-09-09 在 GitHub 查看源码

快速上手

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp && cmake -B build && cmake --build build --config Release -j

# 运行一个 GGUF 模型
./build/bin/llama-cli -model qwen3-8b-q4_k_m.gguf -p "你好"

项目速览

llama.cpp 用纯 C/C++ 实现大模型推理,以极致的量化(4bit/2bit)和跨硬件支持著称——从 Mac、Windows 到树莓派、安卓手机都能跑。它是 GGUF 模型格式的源头,几乎所有本地模型工具链(含 Ollama)底层都依赖它。

能做什么

  • 无显卡设备上推理大模型,内存够就能跑
  • 提供 llama-server,兼容 OpenAI API 格式对外服务
  • 海量社区 GGUF 量化模型直接下载即用

怎么部署

源码编译或用预编译包,从 Hugging Face 拉 GGUF 模型;小白建议直接用包一层的 Ollama 或图形化的 LM Studio。

适合谁

嵌入式/边缘设备开发者、想在旧电脑上跑模型的极客。

不想部署?试试同类在线工具

返回全部开源项目指标每周自动更新,数据来自 GitHub API