跳到正文
原文
Reddit · r/LocalLLaMA· /u/MLDataScientist·· 8 天前AI 评分40

Qwen3.8 flash 配合 Strata 推理引擎在 12GB VRAM 笔记本上实现 51t/s 推理与 1500t/s 上下文读取

Qwen3.8 flash next ISTA-DASLab GGUF 50t/s TG and 1500t/s PP with 12GB VRAM and 64GB RAM Laptop on 'Strata' engine

AI 导读

Strata 推理引擎在配备 5070ti 12GB VRAM、64GB RAM 的笔记本上运行 Qwen3.8 flash 模型,43k 上下文深度下达 51 t/s,较 stock llama.cpp 的 23 t/s 提升超过 2 倍。

来源:Reddit · r/LocalLLaMA · reddit.com