跳到正文
SiliconANGLE· Kyt Dotson·· 3 天前AI 评分40

Ai2 发布 Olmo-core 3,旨在提升大型 MoE 大语言模型的开发效率

Ai2 releases Olmo-core 3 to make developing large mixture-of-experts LLMs more efficient

AI 导读

Allen Institute for AI (Ai2) 发布了用于高效训练混合专家大语言模型的开发框架 Olmo-core 3。该框架使 MoE 模型能在保持计算效率的同时扩展至万亿参数规模,在 Nvidia B3000 GPU 上对 470 亿参数模型的训练吞吐量达到每秒 52,000 个 token,较 Nvidia Megatron-core 架构提升约 2.7 倍。

来源:SiliconANGLE · siliconangle.com