推理部署#量化#CPU 推理#边缘设备#GGUF
llama.cpp · 纯 C/C++ 大模型推理引擎
让大模型跑在 CPU/手机/树莓派上的量化推理引擎,GGUF 格式发起者
快速上手
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp && cmake -B build && cmake --build build --config Release -j
# 运行一个 GGUF 模型
./build/bin/llama-cli -model qwen3-8b-q4_k_m.gguf -p "你好"项目速览
llama.cpp 用纯 C/C++ 实现大模型推理,以极致的量化(4bit/2bit)和跨硬件支持著称——从 Mac、Windows 到树莓派、安卓手机都能跑。它是 GGUF 模型格式的源头,几乎所有本地模型工具链(含 Ollama)底层都依赖它。
能做什么
- 无显卡设备上推理大模型,内存够就能跑
- 提供 llama-server,兼容 OpenAI API 格式对外服务
- 海量社区 GGUF 量化模型直接下载即用
怎么部署
源码编译或用预编译包,从 Hugging Face 拉 GGUF 模型;小白建议直接用包一层的 Ollama 或图形化的 LM Studio。
适合谁
嵌入式/边缘设备开发者、想在旧电脑上跑模型的极客。
不想部署?试试同类在线工具
返回全部开源项目指标每周自动更新,数据来自 GitHub API