跳到正文
原文
Reddit · r/LocalLLaMA· /u/Theboyscampus·· 8 天前AI 评分20

vLLM 批量 API 调用共享前缀的最佳实践

Best practice for processing batch vLLM api calls with shared prefix?

AI 导读

用户在 agent workflow 中使用 asyncio.gather 并发 10 个 vLLM API 调用,这些调用共享相同 prompt 仅在最后查询/指令处不同,询问处理共享前缀批量请求的最佳实践。用户考虑先发送单个请求让 vLLM 完成 cache block 并开始解码,再发送剩余批量请求,通过 router 确保路由至同一 worker。

来源:Reddit · r/LocalLLaMA · reddit.com