← 返回信息流

Reddit r/LocalLLaMA短讯

Qwen3.8-27B Heretic + MTP 在 16GB 显存下的量化方案:55-68 tok/s

reddit.com作者:/u/ZestRocket教程AI评分:50/100

作者针对 RTX 4080 (16GB) 显存限制,对 llmfan46 制作的 Qwen3.8-27B Heretic(保留 MTP 头)进行自定义量化。指出常规 IQ4_XS 量化无法容纳 MTP 参数,而能容纳的仅 3-bit 版本质量较差。通过采用 Unsloth 风格的 per-tensor UD 配方,成功将模型量化至 16GB 显存内,实现 55-68 tok/s 的推理速度,并在保持较低质量损失的同时支持 MTP 功能。提供 24GB 和 12GB 版本备选。

阅读原文