跳到正文
NVIDIA · 开发者博客· Tanya Lenz·· 21 天前AI 评分31

NVIDIA Transformer Engine 在 JAX 中加速无丢弃 MoE 训练

Accelerating Dropless MoE Training in JAX with NVIDIA Transformer Engine

AI 导读

NVIDIA Transformer Engine 通过优化 JAX 中的专家路由,实现了无丢弃的 MoE 训练加速。该技术消除了传统 MoE 训练中因容量因子限制而丢弃 token 的现象,提升了训练效率。

来源:NVIDIA · 开发者博客 · developer.nvidia.com