首页/AI 开源项目/Ternary-Bonsai-2-27B
开源大模型Hugging Face上手难度 🔧 进阶#三值量化#低比特推理#GGUF#端侧大模型#Hugging Face

Ternary-Bonsai-2-27B · 三值量化 27B 推理模型(Prism ML)

5.9GB 跑完整 27B:1.72 比特三值权重保留 FP16 九成八智能,笔记本 47 tok/s

指标同步中,请稍后刷新查看 在 Hugging Face 查看

5 分钟上手

语言模型 5.95GB 常驻,8GB 内存笔记本即可交互;CUDA/Metal/CPU 全支持
# 使用 Prism ML 的 llama.cpp 分支(原版不支持三值格式)
git clone https://github.com/PrismML-Eng/llama.cpp && cd llama.cpp
cmake -B build -DGGML_CUDA=ON && cmake --build build -j
# 下载模型并运行
hf download prism-ml/Ternary-Bonsai-2-27B-gguf Ternary-Bonsai-2-27B-PQ2_0.gguf --local-dir .
./build/bin/llama-cli -m Ternary-Bonsai-2-27B-PQ2_0.gguf -ngl 99 -fa on -c 32768 -n 256

项目速览

Ternary-Bonsai-2-27B 是 Prism ML 于 2026 年 9 月 18 日发布的三值量化大模型,上线一天即冲上 Hugging Face Trending 榜眼(月下载 40 万+)。它将 Qwen3.8-27B 的全部语言权重压缩到 {−1, 0, +1} 三值表示(真实 1.72 比特/权重),体积仅 5.9GB,却在 14 项 thinking 模式基准上拿到 84.78 平均分,保留 FP16 基线 98.2% 的智能。

能做什么

  • 27B 级推理/数学/代码能力装进 5.95GB(PTQ1_0)或 7.21GB(PQ2_0)单文件
  • 数学仅差满精度半分(96.57 vs 97.06),编码持平基线(89.42),Agent 工具调用 74.92
  • 262K token 上下文靠混合注意力骨干(约 75% 线性注意力)在端侧保持可行
  • 可选 Q8_0 视觉塔 mmproj 包,按需加载实现多模态

怎么部署

需使用 Prism ML 定制的 llama.cpp 分支(CUDA/Metal/CPU),原版 llama.cpp 会直接拒绝加载三值格式。Apple Silicon 另有 MLX 2bit 姊妹仓库。

适合谁

想在笔记本或单张消费级显卡上跑 27B 级推理模型与本地 Agent 的开发者。

✅ 优点

  • •5.9GB 保留 FP16 平均 98.2% 智能,推理密集基准(数学/代码)几乎无损
  • •262K 上下文 + 约 75% 线性注意力,端侧长上下文真正可行
  • •M5 Max 实测约 47 tok/s、RTX 5090 约 130 tok/s,交互式流畅
  • •Apache 2.0 许可,附白皮书与专用 CUDA/Metal/MLX 内核

⚠️ 局限与坑

  • •必须用 Prism ML 定制 llama.cpp 分支,原版会拒绝加载甚至静默输出乱码
  • •知识推理与视觉类目损失最明显(视觉 66.19 vs FP16 71.36)
  • •PTQ1_0 密集打包在 H100/A100/Blackwell 上反而更慢,需按硬件选打包

💼 典型应用场景

  • 1.笔记本本地 27B 级 Agent 与长文档分析
  • 2.隐私敏感/离线环境的完整本地推理
  • 3.单张消费级 GPU(甚至 72W L4)部署 27B 服务

不想部署?试试同类在线工具

返回全部开源项目指标每周自动更新