Reddit · r/LocalLLaMA· /u/SignatureMoney6648·· 7 天前AI 评分52
FreeToken vs llama.cpp 在 RTX 3090 上的基准对比
FreeToken vs llama.cpp on one RTX 3090: llama.cpp is 2–3× faster when the MoE fits in VRAM. On gpt-oss-120b (63 GB), FreeToken gets the first token out 7× faster at 32 concurrent users.
AI 导读
在 RTX 3090 上对 1024 tokens in / 256 out、1-32 并发进行基准测试:当模型 fit VRAM 时(Gemma-4-26B-A4B)。
来源:Reddit · r/LocalLLaMA · reddit.com