首页/AI 开源项目/Edge0-35B-A3B-preview
开源大模型Hugging Face上手难度 🔧 进阶#MoE#边缘推理#SSD流式加载#MLX#Hugging Face

Edge0-35B-A3B-preview · 3 GiB 内存跑 35B MoE 的边缘推理模型

35B MoE 只要 3 GiB 内存:专家权重从 SSD 流式加载,两天 3400 赞冲上 Trending

指标同步中,请稍后刷新查看 在 Hugging Face 查看

5 分钟上手

活动内存 <3GiB + 快速 SSD;当前需 Apple Silicon(MLX)
pip install -e 'git+https://github.com/Edge0-AI/edge0.git#egg=edge0[fetch]'
huggingface-cli download Edge0/Edge0-35B-A3B-preview --local-dir ./Edge0-35B
export EDGE0_35B_MODEL=$PWD/Edge0-35B
edge0 chat --name edge0-35b --prompt "Introduce yourself"
# 或起 OpenAI 兼容 HTTP 服务
edge0 serve --name edge0-35b --port 8085

项目速览

Edge0-35B-A3B-preview 是 Edge0 团队 2026 年 9 月发布的预览版模型,配套论文《The Other Half of the Memory Wall》(arXiv 2609.18063)。它让 35B 稀疏 MoE 在不到 3 GiB 的活动内存下跑出 15 tok/s 交互速度,发布两天即在 Hugging Face 收获 3,400+ 点赞。核心是三个机制:专家权重常驻 SSD、按需流式加载;Prerouter 预测头提前一步预取专家(解码提速最高 +59%);Recover-LoRA 用蒸馏把 int4 量化的精度损失压到平均仅 3.9 分。

能做什么

  • Qwen3.6-35B-A3B 的 4-bit 版:AIME 2026 86.6、HumanEval 90.9、MMLU-Pro 81.0
  • Mac mini M4 Pro(24GB)实测 14.9–17.7 tok/s,峰值活动内存 2.9 GiB
  • base + LoRA + prerouter 适配器同仓打包,edge0 框架自动加载
  • 一个只读底座可挂多套 LoRA 适配器,单机构建批量服务

怎么部署

pip 安装 edge0 框架(MLX 后端,当前面向 Apple Silicon),下载模型目录后 edge0 chat 或 edge0 serve 即可。魔搭 ModelScope 同步上架。

适合谁

显存紧张但存储快(NVMe)的端侧/边缘推理场景,以及多租户 LoRA 服务探索者。

✅ 优点

  • •SSD 专家流式加载 + 路由预测预取(+59% 解码吞吐)的思路新颖且论文完整
  • •int4 量化平均只比 FP16 低 3.9 分,数学/代码保留率高
  • •活动内存 2.9 GiB 跑 35B 总参数量级,显存门槛几乎为零
  • •Apache 2.0,HF 与 ModelScope 双平台同步上架

⚠️ 局限与坑

  • •预览版:Agent 工具调用与多步规划能力明确未优化
  • •MLX 后端目前仅支持 Apple Silicon,其他平台在路上
  • •3 GiB 内存数据为短上下文,长上下文 KV 缓存会显著抬高占用

💼 典型应用场景

  • 1.低内存设备跑 35B 级 MoE 对话与推理
  • 2.单机多 LoRA 适配器的批量模型服务
  • 3.研究「内存墙」另一半:存储-计算协同调度

不想部署?试试同类在线工具

返回全部开源项目指标每周自动更新