跳到正文
原文
Reddit · r/LocalLLaMA· /u/SignatureMoney6648·· 7 天前AI 评分52

FreeToken vs llama.cpp 在 RTX 3090 上的基准对比

FreeToken vs llama.cpp on one RTX 3090: llama.cpp is 2–3× faster when the MoE fits in VRAM. On gpt-oss-120b (63 GB), FreeToken gets the first token out 7× faster at 32 concurrent users.

AI 导读

在 RTX 3090 上对 1024 tokens in / 256 out、1-32 并发进行基准测试:当模型 fit VRAM 时(Gemma-4-26B-A4B)。

来源:Reddit · r/LocalLLaMA · reddit.com