跳到正文
PyTorch 博客· Meta Team: Daohang Shi, Oleksandr Stashuk, Rupert Wu, Liangbei Xu, Rich Zhu·· 1 天前AI 评分33

Modernizing Table Batched Embeddings with FBTriton

Modernizing Table Batched Embeddings with FBTriton

AI 导读

FBTriton 实现了 Table Batched Embedding(TBE)的前向和反向传播优化,性能优于传统 CUDA 内核。TBE 在单个 GPU 操作中整合多个表的嵌入查找和池化,减少启动开销并提升内存效率。在 B200 上,启用 fused_bounds_check 可使边界检查部分提速 1.24 倍,且支持通过 TorchRec 配置控制。

来源:PyTorch 博客 · pytorch.org