推理部署上手难度 ⚡ 入门#推理引擎#MoE#C语言#本地部署#GGUF#消费级显卡

colibri · Colibri 蜂鸟推理引擎

GitHub 30k⭐:纯 C 语言 MoE 推理引擎,10KB 零依赖,消费级显卡跑千亿参数大模型

指标同步中,请稍后刷新查看 在 GitHub 查看源码

5 分钟上手

任意消费级 GPU(RTX 3090/4090 即可),支持 x64 CPU 回退
# 下载并运行(无需 Python/CUDA)
curl -LO https://github.com/JustVugg/colibri/releases/latest/download/colibri-linux-x64
chmod +x colibri-linux-x64
./colibri-linux-x64 --model deepseek-v4.gguf --prompt "Hello"

项目速览

Colibri(蜂鸟)是一个纯 C 语言实现的 MoE(混合专家)推理引擎,核心二进制仅 10KB、零外部依赖,却能运行 DeepSeek V4 等千亿参数 MoE 模型。它的核心理念是"你已有的硬件就能跑前沿模型"——通过按需从磁盘流式加载专家(experts),不需要把整个模型塞进显存,消费级显卡(RTX 3090/4090)即可运行之前只有数据中心才能跑的模型。

能做什么

  • 在消费级 GPU 上运行千亿参数 MoE 模型(如 DeepSeek V4)
  • 纯 C 实现,单文件 10KB,零第三方依赖
  • 按需流式加载 expert 权重,显存需求极低
  • 支持 Llama.cpp 格式的 GGUF 模型文件
  • 同时提供 HTTP API 和交互式 CLI

怎么部署

下载单个二进制文件即可运行,无需 Python、PyTorch 或 CUDA 安装。支持所有主流操作系统。

适合谁

显存有限但想运行大模型的 AI 发烧友、想用消费级硬件做本地推理的开发者和研究者。

✅ 优点

  • 纯 C 实现,10KB 零依赖,下载即用
  • 流式加载 expert,显存需求远低于传统方案
  • 无需 Python/CUDA/PyTorch 环境

⚠️ 局限与坑

  • 目前处于早期阶段,API 和功能仍在建设中
  • 仅支持 MoE 架构模型,不支持 Dense 模型
  • 流式加载增加了推理延迟

💼 典型应用场景

  • 1.消费级硬件运行千亿参数大模型
  • 2.本地 AI 推理服务部署
  • 3.模型运行时研究与实验

不想部署?试试同类在线工具

返回全部开源项目指标每周自动更新,数据来自 GitHub API