跳到正文
原文
Reddit · r/LocalLLaMA· /u/your_real_Fathe_·· 7 小时前AI 评分13

4GB VRAM 本地推理场景下是否有比 llama.cpp 更快 tokens/sec 的替代方案

Is there a better option than llama.cpp for 4GB VRAM for Higher tokens/sec?

AI 导读

Reddit r/LocalLLaMA 用户反馈,目前在 RTX 4GB VRAM 消费级硬件上运行本地模型时,尚未找到比 llama.cpp 更优的替代方案:调研中遇到的多数推理框架基于 Python 及 PyTorch 等重型依赖,加载模型前就会耗尽有限显存;其余选项要么面向非量化模型,要么基于两年前的旧模型,要么针对完全不同的设备类别,或停留在没有实现的论文阶段。

来源:Reddit · r/LocalLLaMA · reddit.com