跳到正文
原文
Reddit · r/LocalLLaMA· /u/okoyl3·· 4 天前AI 评分39

Strata 分支在 IBM AC922 上运行 Qwen3.8-FN UD-Q4_K_XL 实现 7357 tok/s prefill 和 113 tok/s decode

A Strata fork for IBM AC922 running Qwen3.8-FN UD-Q4_K_XL is doing up to 7,357 tk/s prefill and 113 tk/s decode

AI 导读

开发者在 IBM AC922(双 POWER9 20 核 CPU + 4×16GB Tesla V100 GPU)上对 Strata 进行深度优化,使用 Qwen3.8-FN UD-Q4_K_XL 模型达到 7357 tok/s prefill 速度和 113 tok/s decode 速度。

来源:Reddit · r/LocalLLaMA · reddit.com