PyTorch 博客· Sean Chen (Red Hat) and Shangdi Yu (PyTorch, Meta Platforms)·· 2 天前AI 评分42
使用 Helion 为 vLLM 构建高性能可移植的线性后端
Building a High-Performance and Portable vLLM Linear Backend with Helion
AI 导读
研究团队将 Helion 集成到 vLLM 的线性后端,以探索其自动调优的高层内核 DSL 如何提升大语言模型推理性能并降低内核实现复杂度。在 NVIDIA Hopper GPU 上,该后端通过逐形状调优与混合调度,在评估的模型中性能超越了 vLLM 默认的 CUTLASS 和 DeepGEMM 后端,部分工作负载的吞吐量提升超过 10%。
来源:PyTorch 博客 · pytorch.org