跳到正文
原文
Reddit · r/LocalLLaMA· /u/-dysangel-·· 4 天前AI 评分34

本地跑酷模拟器实现:GLM-4-Flash + 2x DGX Sparks + vllm TP2 推理

Fully local little parkour sim

AI 导读

开发者在 2x DGX Sparks 服务器上运行 GLM-4-Flash 模型,实现完全本地化的跑酷模拟器。采用 vllm TP2 方案,Prefill 吞吐量约 1500token/s,Decode 约 40token/s,支持 100k 上下文。

来源:Reddit · r/LocalLLaMA · reddit.com