← 返回信息流

Reddit r/LocalLLaMA短讯

Qwen3.8-Flash-Next-GSQ-RCO (IQ3_S) 在 12GB VRAM + 32GB RAM 下实现 ~20-30 tok/sec 解码与 300-90k tok/sec 预填充

reddit.com作者:/u/bodhi371模型开源AI评分:70/100

作者使用自定义 Strata 分支,成功在仅 12GB 显存和 32GB 系统内存的硬件上运行 Qwen3.8-Flash-Next-GSQ-RCO-Abliterated 模型(IQ3_S 量化)。实测解码速度约 20-30 token/秒(Q2 量化可达 39-45 token/秒),预填充速度达 300 至约 9 万 token/秒(131k 上下文)。该自定义分支包含大量实验性架构改动,性能表现优异,被形容为“本地版 Opus”,且计算成本低于 2k。

阅读原文