Reddit · r/LocalLLaMA· /u/KingCpzombie·· 6 小时前AI 评分9
Radeon R9700 多卡推理 GLM5.3-Flash 等大模型的引擎选择讨论
Best current R9700 inference engine?
AI 导读
用户计划用 6 张 R9700 显卡加系统内存运行 GLM5.3-Flash,并尝试 Q-FN / DSv4-vision 等能塞进显存的大模型。发帖者认为 Radiance VLLM 最适合完全装入 GPU 的模型,而 llama.cpp 类的方案更适合 MoE 模型溢写到系统内存的场景。由于 R9700 推理引擎分叉过多,他希望社区推荐当前最合适的方案。
来源:Reddit · r/LocalLLaMA · reddit.com