Google Research·· 2026-03-25精选AI 评分63
Google发布TurboQuant:面向极端压缩的向量量化新算法
TurboQuant: Redefining AI efficiency with extreme compression
AI 导读
Google Research发布TurboQuant、QJL和PolarQuant三种向量量化压缩算法,可在Gemma和Mistral模型上将KV cache内存降低至少6倍,同时保持模型性能不变。
推荐理由
原文给出了6x内存降低和8x性能提升的具体数据,以及TurboQuant、QJL、PolarQuant三种算法的技术原理,读者可以据此了解向量量化技术的最新进展。
来源:Google Research · research.google