开源大模型Hugging Face上手难度 🔧 进阶#三值量化#低比特推理#GGUF#端侧大模型#Hugging Face
Ternary-Bonsai-2-27B · 三值量化 27B 推理模型(Prism ML)
5.9GB 跑完整 27B:1.72 比特三值权重保留 FP16 九成八智能,笔记本 47 tok/s
指标同步中,请稍后刷新查看 在 Hugging Face 查看
5 分钟上手
语言模型 5.95GB 常驻,8GB 内存笔记本即可交互;CUDA/Metal/CPU 全支持# 使用 Prism ML 的 llama.cpp 分支(原版不支持三值格式)
git clone https://github.com/PrismML-Eng/llama.cpp && cd llama.cpp
cmake -B build -DGGML_CUDA=ON && cmake --build build -j
# 下载模型并运行
hf download prism-ml/Ternary-Bonsai-2-27B-gguf Ternary-Bonsai-2-27B-PQ2_0.gguf --local-dir .
./build/bin/llama-cli -m Ternary-Bonsai-2-27B-PQ2_0.gguf -ngl 99 -fa on -c 32768 -n 256项目速览
Ternary-Bonsai-2-27B 是 Prism ML 于 2026 年 9 月 18 日发布的三值量化大模型,上线一天即冲上 Hugging Face Trending 榜眼(月下载 40 万+)。它将 Qwen3.8-27B 的全部语言权重压缩到 {−1, 0, +1} 三值表示(真实 1.72 比特/权重),体积仅 5.9GB,却在 14 项 thinking 模式基准上拿到 84.78 平均分,保留 FP16 基线 98.2% 的智能。
能做什么
- 27B 级推理/数学/代码能力装进 5.95GB(PTQ1_0)或 7.21GB(PQ2_0)单文件
- 数学仅差满精度半分(96.57 vs 97.06),编码持平基线(89.42),Agent 工具调用 74.92
- 262K token 上下文靠混合注意力骨干(约 75% 线性注意力)在端侧保持可行
- 可选 Q8_0 视觉塔 mmproj 包,按需加载实现多模态
怎么部署
需使用 Prism ML 定制的 llama.cpp 分支(CUDA/Metal/CPU),原版 llama.cpp 会直接拒绝加载三值格式。Apple Silicon 另有 MLX 2bit 姊妹仓库。
适合谁
想在笔记本或单张消费级显卡上跑 27B 级推理模型与本地 Agent 的开发者。
✅ 优点
- •5.9GB 保留 FP16 平均 98.2% 智能,推理密集基准(数学/代码)几乎无损
- •262K 上下文 + 约 75% 线性注意力,端侧长上下文真正可行
- •M5 Max 实测约 47 tok/s、RTX 5090 约 130 tok/s,交互式流畅
- •Apache 2.0 许可,附白皮书与专用 CUDA/Metal/MLX 内核
⚠️ 局限与坑
- •必须用 Prism ML 定制 llama.cpp 分支,原版会拒绝加载甚至静默输出乱码
- •知识推理与视觉类目损失最明显(视觉 66.19 vs FP16 71.36)
- •PTQ1_0 密集打包在 H100/A100/Blackwell 上反而更慢,需按硬件选打包
💼 典型应用场景
- 1.笔记本本地 27B 级 Agent 与长文档分析
- 2.隐私敏感/离线环境的完整本地推理
- 3.单张消费级 GPU(甚至 72W L4)部署 27B 服务
🔗 资源直达
开源大模型· 同类项目推荐
返回全部开源项目指标每周自动更新