跳到正文
PyTorch 博客· Sean Chen (Red Hat) and Shangdi Yu (PyTorch, Meta Platforms)·· 2 天前AI 评分42

使用 Helion 为 vLLM 构建高性能可移植的线性后端

Building a High-Performance and Portable vLLM Linear Backend with Helion

AI 导读

研究团队将 Helion 集成到 vLLM 的线性后端,以探索其自动调优的高层内核 DSL 如何提升大语言模型推理性能并降低内核实现复杂度。在 NVIDIA Hopper GPU 上,该后端通过逐形状调优与混合调度,在评估的模型中性能超越了 vLLM 默认的 CUTLASS 和 DeepGEMM 后端,部分工作负载的吞吐量提升超过 10%。

来源:PyTorch 博客 · pytorch.org