vLLM 完整介绍
一、什么是 vLLM
vLLM 是加州伯克利团队开源的大模型高吞吐量推理引擎,核心目标:解决原生 PyTorch 推理慢、并发低、显存占用高的问题,主打离线批量推理、在线API服务、本地部署LLM。 全称:very Large Language Model inference engine Github:https://github.com/vllm-project/vllm
核心优势
- PagedAttention(分页注意力)
独创显存管理算法,类比操作系统虚拟内存分页,解决传统推理 KV Cache 碎片化问题:
- 显存利用率提升 2~4 倍
- 并发请求吞吐...