推理部署#推理平台#多模态#企业级#国产开源
Xorbits Inference (Xinference) · 异构模型统一推理平台
一个平台管理 LLM/语音/多模态等上百种开源模型的分布式推理服务
快速上手
pip install "xinference[all]"
xinference-local --host 0.0.0.0 --port 9997
# 打开 http://localhost:9997 在网页里选择模型启动项目速览
Xinference 由 XORBIT 开源,定位是企业级「模型服务器」:不止语言模型,语音识别、TTS、Embedding、多模态模型都能在同一个平台按需拉起,支持异构 GPU 与分布式部署,是国内开源推理平台中模型覆盖面最广的之一。
能做什么
- 控制台一键部署上百种预置模型,或自定义接入
- 统一 OpenAI 兼容 API 出口,业务侧无需关心底层差异
- 支持多机多卡分布式,覆盖生产级吞吐需求
怎么部署
pip 安装或 Docker Compose 拉起。若只需单机单模型,vLLM 更轻。
适合谁
需要同时服务多种模型类型、集中管理的中小型企业平台团队。
返回全部开源项目指标每周自动更新,数据来自 GitHub API