Reddit · r/LocalLLaMA· /u/Prestigious-Taste-63·· 4 天前AI 评分49
从零训练 3.87B MoE 模型:86.5B tokens 预训练结果分享
I trained a 3.87B MoE (1.45B active) from scratch on only 86.5B tokens
AI 导读
独立开发者从零训练了一个 3.87B MoE 模型(1.45B active),使用 86.5B tokens 预训练数据。该模型在 HumanEval 上达 43.9,代码能力与使用 18T tokens 训练的 Qwen2.5-1.5B 相当。局限性包括:英语中心化、知识记忆弱、4k 上下文限制,DPO 训练反而导致性能下降。
来源:Reddit · r/LocalLLaMA · reddit.com