vLLM 作为高性能 LLM 推理引擎,一直以 PagedAttention 和高效调度著称。最新推出的原生 Transformers 建模后端,意味着开发者可以直接使用 Hugging Face Transformers 模型定义,而无需为每个模型编写自定义 CUDA 内核。

发生了什么

vLLM 团队宣布推出原生 Transformers 建模后端(native-speed vLLM transformers modeling backend)。该后端允许 vLLM 直接加载并运行 Hugging Face Transformers 模型,无需手动适配或编写专用算子。初步基准测试显示,该后端在保持与原生 vLLM 相近推理速度的同时,显著降低了模型移植成本。

为什么重要

此前,vLLM 支持新模型通常需要社区贡献者或开发者为其编写特定的 PagedAttention 实现和内核优化,这导致大量 Transformers 模型无法开箱即用。原生后端打破了这一瓶颈:它利用 Transformers 的标准化接口,自动兼容绝大多数架构,同时通过 vLLM 的调度和内存管理保持高性能。这意味着开发者可以更快地实验最新模型,而运维团队也能更轻松地统一推理栈。

影响与看点

对开发者而言,模型部署门槛大幅降低——只需几行代码即可将 Transformers 模型接入 vLLM 生产环境。对社区而言,模型生态的兼容性将快速扩展,尤其是那些尚未被 vLLM 原生支持的新架构。但需注意,原生后端在极端吞吐场景下可能略逊于手写内核,因此对于已高度优化的模型(如 LLaMA),原生后端更适合快速验证而非极致压榨性能。值得关注的是,这一设计思路可能推动更多推理引擎向“兼容层+可插拔优化”方向发展。