推理部署#推理框架#生产级#高并发#OpenAI 兼容

vLLM · 高吞吐大模型推理服务框架

PagedAttention 技术开创者,生产级 LLM 推理服务的事实标准

91k stars 22k forksPython Apache-2.0 最近提交 2026-09-09 在 GitHub 查看源码

快速上手

pip install vllm

# 起一个 OpenAI 兼容服务
vllm serve Qwen/Qwen3-8B --port 8000
# 之后用 OpenAI SDK 指向 http://localhost:8000/v1 即可

项目速览

vLLM 起源于 UC Berkeley 的 LMDeploy 之外的另一条高性能路线:用 PagedAttention 把显存利用率做到极致,同硬件下吞吐量远超原生 transformers 推理。如今是各大模型厂商发布权重后第一批适配的推理框架。

能做什么

  • 高并发 OpenAI 兼容推理服务,生产部署首选
  • 支持连续批处理、张量并行、量化加载(AWQ/GPTQ/FP8)
  • 配合 Xinference 等平台可做集群化模型管理

怎么部署

pip 安装即可用,需要 NVIDIA 显卡(消费级 12G 显存可跑 7-8B)。个人体验无需部署,用 Ollama 更省事。

适合谁

要给产品/团队提供稳定大模型 API 服务的后端工程师。

不想部署?试试同类在线工具

返回全部开源项目指标每周自动更新,数据来自 GitHub API