← 返回信息流

Reddit r/LocalLLaMA短讯

AVX2:加速IQ模型大批量提示处理

reddit.com作者:/u/pmttyji开源评测AI评分:70/100

llama.cpp 的 PR #27402 通过 AVX2 优化,大幅提升 IQ 量化模型在 CPU 上大批量(如 512)提示处理的速度。在 EPYC 9654 上测试,PPL 不变,速度提升显著。

阅读原文