Reddit r/LocalLLaMA短讯中文原文AVX2:加速IQ模型大批量提示处理10 小时前reddit.com作者:/u/pmttyji开源评测AI评分:70/100llama.cpp 的 PR #27402 通过 AVX2 优化,大幅提升 IQ 量化模型在 CPU 上大批量(如 512)提示处理的速度。在 EPYC 9654 上测试,PPL 不变,速度提升显著。阅读原文