跳到正文
原文
Google Research·· 2026-03-25精选AI 评分63

Google发布TurboQuant:面向极端压缩的向量量化新算法

TurboQuant: Redefining AI efficiency with extreme compression

AI 导读

Google Research发布TurboQuant、QJL和PolarQuant三种向量量化压缩算法,可在Gemma和Mistral模型上将KV cache内存降低至少6倍,同时保持模型性能不变。

推荐理由

原文给出了6x内存降低和8x性能提升的具体数据,以及TurboQuant、QJL、PolarQuant三种算法的技术原理,读者可以据此了解向量量化技术的最新进展。

来源:Google Research · research.google