热点事件持续更新
社区发布Gemma4 E4B EXL3量化版本及Jetson Orin优化分支
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
社区开发者 little-gemma 推出了 Gemma 4 E4B 模型的 EXL3 量化推理方案,并发布了适配 Jetson Orin Nano 的移植版本。该开发者 fork 了 exllamav3 项目,针对 Jetson Orin Nano Super 8GB 设备进行优化。在该硬件上的测试结果显示,Gemma 4 E4B 的 prefill(预填充)速度相较于 llama.cpp 方案有显著提升,但解码速率有所下降。综合来看,语音对话场景下的整体延迟表现仍优于 llama.cpp。这一 EXL3 量化与 Jetson 优化分支为在边缘设备上部署 Gemma 4 E4B 提供了新的选择。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月12日
- Reddit · r/LocalLLaMA社区开发者为 Jetson Orin Nano 适配 Gemma 4 E4B 的 EXL3 推理方案
开发者 little-gemma V1.0 移植并 fork 了 exllamav3,在 Jetson Orin Nano Super 8GB 上运行 Gemma 4 E4B,prefill 速度较 llama.cpp 显著提升,尽管解码速率有所下降,整体语音对话延迟仍更低。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。