跳到正文
PyTorch 博客· Thomas Parnell (IBM), Thomas Ortner (IBM), Richard Zou (Meta), Harry Mellor (Hugging Face)·· 13 天前AI 评分52

vLLM 引入硬件无关层以支持多样化硬件和模型

Hardware-Agnostic Models in vLLM

AI 导读

vLLM 正在引入一套新的硬件无关层,旨在确保项目在追求前沿 GPU 性能的同时,能继续支持多样化硬件和模型。这套新层遵循可编译、可扩展、隔离和可移植四大设计原则,已在 transformers 后端中提供初步支持。在 NVIDIA H100 GPU 上的测试表明,其 token 吞吐量与原生实现相比差距在 3.4% 以内。

来源:PyTorch 博客 · pytorch.org