Reddit · r/LocalLLaMA· /u/Theboyscampus·· 8 天前AI 评分20
vLLM 批量 API 调用共享前缀的最佳实践
Best practice for processing batch vLLM api calls with shared prefix?
AI 导读
用户在 agent workflow 中使用 asyncio.gather 并发 10 个 vLLM API 调用,这些调用共享相同 prompt 仅在最后查询/指令处不同,询问处理共享前缀批量请求的最佳实践。用户考虑先发送单个请求让 vLLM 完成 cache block 并开始解码,再发送剩余批量请求,通过 router 确保路由至同一 worker。
来源:Reddit · r/LocalLLaMA · reddit.com