vLLM

高吞吐大模型推理与服务引擎,PagedAttention 显存高效。

访问vLLM官网

工具介绍

项目简介高吞吐大模型推理与服务引擎,PagedAttention 显存高效。核心特性PagedAttention高吞吐OpenAI 兼容接口获取方式通过上述官方开源仓库(通常为 GitHub)克隆或下载,按 README 安装依赖即可本地部署与二次开发。

功能特点

标签:vLLM 推理 高吞吐 部署

分类:推理与部署工具