Reddit r/LocalLLaMA短讯
Gemma4 E4B EXL3 - Jetson Orin 上 llama.cpp 的替代方案
reddit.com作者:/u/cortexist教程AI评分:50/100
作者开发了 little-gemma V1.0,在 Jetson Orin 上显著优于 llama.cpp。针对 Gemma E4B 量化模型,通过 fork exllamav3 并移植关键代码,实现了预填充(prefill)性能提升,尽管解码速率有所下降,但整体语音聊天延迟降低。该方案适用于 Jetson Orin Nano 8GB 设备,旨在解决端侧大模型推理性能瓶颈。