跳到正文
原文
Berkeley AI Research·· 2026-07-29精选AI 评分65

K-Search:如何将数十年CUDA内核优化经验迁移到Apple Silicon

From CUDA to MLX: How K-Search Brings Decades of Kernel Expertise to Apple Silicon

AI 导读

Berkeley和IBM研究团队将K-Search进化内核优化框架扩展支持MLX后端,开发了结构化的CUDA到MLX翻译层,将NVIDIA生态积累的CUDA优化知识迁移到Apple Silicon。实验在M1 Max 64GB上,Attention核达到原生MLX的0.97倍性能,Mamba SSM核预填充吞吐量达6751 tok/s,比社区mlx-lm实现快约20倍。

推荐理由

原文展示了K-Search如何将NVIDIA生态积累的CUDA内核优化知识迁移到Apple Silicon,在Attention和Mamba SSM两个核上分别达到接近专家水平和20倍加速,为非NVIDIA硬件的核优化提供了可参考的方法论。

来源:Berkeley AI Research · bair.berkeley.edu