Hugging Face Blog·· 7 天前精选AI 评分61
AllenAI 发布 Olmo-core 3:面向大规模 MoE 的开源可扩展训练基础设施
Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs
AI 导读
AllenAI 发布 Olmo-core 3 训练框架,支持将专家池从 8 扩展到 128 而每 token 仅激活 4 个专家,总参数量从 4.6B 增至 47B,训练吞吐量仅下降不到 5%。在 8 个 NVIDIA B300 GPU 上,47B MoE 达 52,000 tokens/s/GPU,约为此前实现的 2.7 倍。系统已测试至 1.2 万亿参数规模。
推荐理由
原文给出了专家池扩展、吞吐量提升和参数规模的具体数字,读者可以据此判断这套训练基础设施对大模型研究的具体价值。
来源:Hugging Face Blog · huggingface.co
最近 7 天的更新
- Mistral 发布开源 24B 模型 Mistral Small 3,主打低延迟本地推理Mistral AI·
- Stable Diffusion 3.5 现已在 Replicate 可用Replicate Blog·
- Cloudflare 发布 Artifacts 新功能并发起下一代 Git 平台竞赛Hacker News · 首页·
- Aleph Alpha 发布 Kolibri 主权开放权重模型Hacker News · 首页·
- Aleph Alpha 发布开放权重模型 Kolibri,支持德语和英语Hacker News · 首页·
- Singularity:原子化 ticket 驱动的 AI 编码工具Product Hunt · AI 分类·
- eu/jev 发布欧盟版 System One 模型Product Hunt · AI 分类·
- Allen AI 开源 AstaBrief 8B 科学报告生成模型Hugging Face Blog·
相关工具
- Slipstream 发布:可在 64GB Mac 上以 41-52 tok/s 运行 95.5 GiB Qwen3.8-Flash-Next81
- Jeff-Qwen3.5-0.8B v1.2 + 9 个 LoRA 适配器:置于 Qwen3.8-27B 前实现 38 倍加速和 +8.7 准确率,额外内存占用不足 2GB80
- Hugging Face 发布 @huggingface/kernels:207 个 WebGPU 内核支持本地 AI 推理74
- Hugging Face 发布 Open TTS Leaderboard:开源多语言 TTS 与语音克隆的可扩展评估70
- Hugging Face 开源 Grabette:手持式机器人操作数据采集系统70
- Google Research 在 I/O 2026 展示多项研究进展:科学工具、医疗健康、边缘计算、天气预测等70
- Microsoft Foundry 支持一键部署 Hugging Face 开源模型68
- Mistral 发布 Codestral 25.08 及完整企业编码工具栈68