开源大模型Hugging Face上手难度 🔧 进阶#MoE#边缘推理#SSD流式加载#MLX#Hugging Face
Edge0-35B-A3B-preview · 3 GiB 内存跑 35B MoE 的边缘推理模型
35B MoE 只要 3 GiB 内存:专家权重从 SSD 流式加载,两天 3400 赞冲上 Trending
指标同步中,请稍后刷新查看 在 Hugging Face 查看
5 分钟上手
活动内存 <3GiB + 快速 SSD;当前需 Apple Silicon(MLX)pip install -e 'git+https://github.com/Edge0-AI/edge0.git#egg=edge0[fetch]'
huggingface-cli download Edge0/Edge0-35B-A3B-preview --local-dir ./Edge0-35B
export EDGE0_35B_MODEL=$PWD/Edge0-35B
edge0 chat --name edge0-35b --prompt "Introduce yourself"
# 或起 OpenAI 兼容 HTTP 服务
edge0 serve --name edge0-35b --port 8085项目速览
Edge0-35B-A3B-preview 是 Edge0 团队 2026 年 9 月发布的预览版模型,配套论文《The Other Half of the Memory Wall》(arXiv 2609.18063)。它让 35B 稀疏 MoE 在不到 3 GiB 的活动内存下跑出 15 tok/s 交互速度,发布两天即在 Hugging Face 收获 3,400+ 点赞。核心是三个机制:专家权重常驻 SSD、按需流式加载;Prerouter 预测头提前一步预取专家(解码提速最高 +59%);Recover-LoRA 用蒸馏把 int4 量化的精度损失压到平均仅 3.9 分。
能做什么
- Qwen3.6-35B-A3B 的 4-bit 版:AIME 2026 86.6、HumanEval 90.9、MMLU-Pro 81.0
- Mac mini M4 Pro(24GB)实测 14.9–17.7 tok/s,峰值活动内存 2.9 GiB
- base + LoRA + prerouter 适配器同仓打包,edge0 框架自动加载
- 一个只读底座可挂多套 LoRA 适配器,单机构建批量服务
怎么部署
pip 安装 edge0 框架(MLX 后端,当前面向 Apple Silicon),下载模型目录后 edge0 chat 或 edge0 serve 即可。魔搭 ModelScope 同步上架。
适合谁
显存紧张但存储快(NVMe)的端侧/边缘推理场景,以及多租户 LoRA 服务探索者。
✅ 优点
- •SSD 专家流式加载 + 路由预测预取(+59% 解码吞吐)的思路新颖且论文完整
- •int4 量化平均只比 FP16 低 3.9 分,数学/代码保留率高
- •活动内存 2.9 GiB 跑 35B 总参数量级,显存门槛几乎为零
- •Apache 2.0,HF 与 ModelScope 双平台同步上架
⚠️ 局限与坑
- •预览版:Agent 工具调用与多步规划能力明确未优化
- •MLX 后端目前仅支持 Apple Silicon,其他平台在路上
- •3 GiB 内存数据为短上下文,长上下文 KV 缓存会显著抬高占用
💼 典型应用场景
- 1.低内存设备跑 35B 级 MoE 对话与推理
- 2.单机多 LoRA 适配器的批量模型服务
- 3.研究「内存墙」另一半:存储-计算协同调度
🔗 资源直达
不想部署?试试同类在线工具
开源大模型· 同类项目推荐
返回全部开源项目指标每周自动更新