跳到正文
Together AI·· 2026-06-23精选AI 评分62

Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,前沿模型表现不佳

ParallelKernelBench: Frontier LLMs can't write fast multi-GPU kernels (yet)

AI 导读

Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,用于评估大模型编写跨 GPU 通信 CUDA 内核的能力。在 87 个真实代码问题中,表现最佳的 GPT-5.5 在单次尝试下仅正确解决 28 个问题,其中仅 22 个快于 PyTorch + NCCL 基线。研究揭示了模型在协调 GPU 间通信、数据分区和选择最优传输机制方面存在根本性困难。

来源:Together AI · together.ai