跳到正文
热点事件持续更新

社区发布Gemma4 E4B EXL3量化版本及Jetson Orin优化分支

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

社区开发者 little-gemma 推出了 Gemma 4 E4B 模型的 EXL3 量化推理方案,并发布了适配 Jetson Orin Nano 的移植版本。该开发者 fork 了 exllamav3 项目,针对 Jetson Orin Nano Super 8GB 设备进行优化。在该硬件上的测试结果显示,Gemma 4 E4B 的 prefill(预填充)速度相较于 llama.cpp 方案有显著提升,但解码速率有所下降。综合来看,语音对话场景下的整体延迟表现仍优于 llama.cpp。这一 EXL3 量化与 Jetson 优化分支为在边缘设备上部署 Gemma 4 E4B 提供了新的选择。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月12日
  1. Reddit · r/LocalLLaMA
    社区开发者为 Jetson Orin Nano 适配 Gemma 4 E4B 的 EXL3 推理方案

    开发者 little-gemma V1.0 移植并 fork 了 exllamav3,在 Jetson Orin Nano Super 8GB 上运行 Gemma 4 E4B,prefill 速度较 llama.cpp 显著提升,尽管解码速率有所下降,整体语音对话延迟仍更低。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。