Reddit · r/LocalLLaMA· /u/sloptimizer·· 9 天前AI 评分58
vLLM 新增专家 RAM offloading 功能
RAM Offloading with vLLM - tcclaviger appreciation post
AI 导读
感谢开发者 tcclaviger,vLLM 新增了专家 RAM offloading 支持,使前沿模型在本地部署更易实现。作者在四块 R9700 GPU 上成功运行了 DeepSeek-V4-Flash-Vision-Exp,并提供了完整的 podman 运行命令和配置参数。
来源:Reddit · r/LocalLLaMA · reddit.com