跳到正文
原文
Reddit · r/LocalLLaMA· /u/Ok-Breadfruit-3523·· 5 小时前AI 评分19

玩家用 4 张 BC-250 矿卡组本地集群,跑到 ~70 tok/s 100K 上下文 / 145 tok/s 双实例 Qwen3.6 35B A3B

Running Next Flash IQ3_XXS at ~70 tok/s with 100k context or 2 instances of Qwen 3.6 35B A3B IQ4 at ~145 tok/s with 256k all on $500 of ex mining BC-250 boards

AI 导读

用户用 4 张二手约 $500 的 BC-250 矿卡组成本地推理集群,搭载 llama.cpp + Vulkan + RPC。Next Flash IQ3_XXS 实现 100K 上下文下 ~60–70 tok/s(ppt ~150),同时运行两实例 Qwen3.6 35B A3B IQ4_K_M 可达 145 tok/s(ppt ~450),可用上下文扩到 258K。

来源:Reddit · r/LocalLLaMA · reddit.com