推理部署#推理框架#生产级#高并发#OpenAI 兼容
vLLM · 高吞吐大模型推理服务框架
PagedAttention 技术开创者,生产级 LLM 推理服务的事实标准
快速上手
pip install vllm
# 起一个 OpenAI 兼容服务
vllm serve Qwen/Qwen3-8B --port 8000
# 之后用 OpenAI SDK 指向 http://localhost:8000/v1 即可项目速览
vLLM 起源于 UC Berkeley 的 LMDeploy 之外的另一条高性能路线:用 PagedAttention 把显存利用率做到极致,同硬件下吞吐量远超原生 transformers 推理。如今是各大模型厂商发布权重后第一批适配的推理框架。
能做什么
- 高并发 OpenAI 兼容推理服务,生产部署首选
- 支持连续批处理、张量并行、量化加载(AWQ/GPTQ/FP8)
- 配合 Xinference 等平台可做集群化模型管理
怎么部署
pip 安装即可用,需要 NVIDIA 显卡(消费级 12G 显存可跑 7-8B)。个人体验无需部署,用 Ollama 更省事。
适合谁
要给产品/团队提供稳定大模型 API 服务的后端工程师。
不想部署?试试同类在线工具
返回全部开源项目指标每周自动更新,数据来自 GitHub API