热点事件观察中
Strix Halo迷你PC成功运行超大规模MoE模型
2 篇报道1 个报道来源3 天前更新
先了解这件事
AI 综述
2026年10月3日,开源项目Kyojin发布新版本引擎,基于ExLlamaV3构建,成功在搭载128GB内存的AMD Strix Halo迷你PC上运行两个约3000亿参数的MoE(混合专家)模型。作者在Reddit社区r/LocalLLaMA分享了这一成果,展示了消费级硬件运行超大规模语言模型的可行性。10月5日,同一团队在搭载Ryzen AI Max+ 395、128GB内存的Strix Halo迷你PC上再次取得进展,成功运行Qwen3.8-Flash-Next模型(125B MoE,激活6B),在投机解码下达到44-59 tok/s的推理速度,并同步开源了Kyojin推理引擎。AMD Strix Halo是AMD面向高端迷你PC和笔记本的APU产品,集成强大的CPU和GPU核心,这一系列突破打破了此前普遍认为需要更昂贵硬件才能运行超大规模模型的认知。
AI 根据报道生成 · 3 天前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- Reddit · r/LocalLLaMAQwen3.8-Flash-Next (125B) 在单台 Strix Halo 迷你 PC 上跑通:投机解码下 44-59 tok/s,开源推理引擎同步发布
团队在搭载 Ryzen AI Max+ 395、128 GB 内存的 Strix Halo 迷你 PC 上成功运行 Qwen3.8-Flash-Next(125B MoE,激活 6B),并同步开源其推理引擎 Kyojin(基于 ExLlamaV3 构建)。
10月3日
- Reddit · r/LocalLLaMA开源引擎 Kyojin 发布:在 128GB AMD Strix Halo 迷你 PC 上运行 300B MoE 模型
作者在 AMD Strix Halo(128GB)上基于 ExLlamaV3 构建了 Kyojin 引擎,成功运行两个约 300B 的 MoE 模型。
本事件热度走势
当前热度 3·可比范围峰值 10(10月3日 23:00)·近 24 小时可比范围变化 -51%
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。