跳到正文
原文
Hugging Face Blog·· 7 天前精选AI 评分61

AllenAI 发布 Olmo-core 3:面向大规模 MoE 的开源可扩展训练基础设施

Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs

AI 导读

AllenAI 发布 Olmo-core 3 训练框架,支持将专家池从 8 扩展到 128 而每 token 仅激活 4 个专家,总参数量从 4.6B 增至 47B,训练吞吐量仅下降不到 5%。在 8 个 NVIDIA B300 GPU 上,47B MoE 达 52,000 tokens/s/GPU,约为此前实现的 2.7 倍。系统已测试至 1.2 万亿参数规模。

推荐理由

原文给出了专家池扩展、吞吐量提升和参数规模的具体数字,读者可以据此判断这套训练基础设施对大模型研究的具体价值。

来源:Hugging Face Blog · huggingface.co