1
热点
Reddit r/LocalLLaMAby /u/pmttyji · 短讯
AVX2:加速IQ模型大批量提示处理
llama.cpp 的 PR #27402 通过 AVX2 优化,大幅提升 IQ 量化模型在 CPU 上大批量(如 512)提示处理的速度。在 EPYC 9654 上测试,PPL 不变,速度提升显著。
llama.cpp 的 PR #27402 通过 AVX2 优化,大幅提升 IQ 量化模型在 CPU 上大批量(如 512)提示处理的速度。在 EPYC 9654 上测试,PPL 不变,速度提升显著。
TinySearch v0.6.1 发布,这是一个自托管的 MCP/FastAPI 工具,用于本地 LLM 的网络搜索。它使用 BM25 和本地 ONNX 嵌入,在内容进入模型上下文窗口前筛选有用部分,无需 LLM 参与过滤。新版本支持自带浏览器。
作者看到社区讨论 Qwen3.8 和 3.6 结构相似,于是尝试用 Qwen3.8-27B-UD-Q6_K_XL.gguf 合并两者的 HF 权重,结果可行,但仅通过冒烟测试。脚本和想法已放在模型仓库的 replicate/ 目录下。