PyTorch 博客· Thomas Parnell (IBM), Thomas Ortner (IBM), Richard Zou (Meta), Harry Mellor (Hugging Face)·· 13 天前AI 评分52
vLLM 引入硬件无关层以支持多样化硬件和模型
Hardware-Agnostic Models in vLLM
AI 导读
vLLM 正在引入一套新的硬件无关层,旨在确保项目在追求前沿 GPU 性能的同时,能继续支持多样化硬件和模型。这套新层遵循可编译、可扩展、隔离和可移植四大设计原则,已在 transformers 后端中提供初步支持。在 NVIDIA H100 GPU 上的测试表明,其 token 吞吐量与原生实现相比差距在 3.4% 以内。
来源:PyTorch 博客 · pytorch.org