跳到正文
原文
Reddit · r/LocalLLaMA· /u/Prestigious-Taste-63·· 3 天前AI 评分32

Apex-2 训练复盘:单卡 H100 瓶颈、DiLoCo 多实例合并与 FineWeb-Edu 去重经验

Lessons learned while building Apex-2

AI 导读

开发者复盘了自训模型 Apex-2 的经验。原计划用约 1T tokens 训练,但单卡 H100 算力不足,最终只训了约 80B tokens;改用两台 GH200 实例按 DiLoCo 方式每 350 步合并模型,训练速度约为单卡的 1.9x,每张 GPU MFU 约 40%。

来源:Reddit · r/LocalLLaMA · reddit.com