跳到正文
原文
Reddit · r/LocalLLaMA· /u/Cautious_Chicken_604·· 4 天前AI 评分41

64GB 系统内存的困境:Strata 让 Qwen3.8-Flash-Next 推理提速至 60 t/s,但模型加载后内存占用达 96%

The curse of 64GB system RAM

AI 导读

用户在 64GB DDR5 内存机器上测试 Strata 框架运行 Qwen3.8-Flash-Next(IQ3_XXS 量化,约 70GB),推理速度从 llama.cpp 的 21 t/s 提升至 60 t/s,但加载 QFN 后系统内存使用率高达 96%,无法同时运行需要大量系统内存的 Minimax H3。

来源:Reddit · r/LocalLLaMA · reddit.com