Reddit r/LocalLLaMA短讯
实测 Strata 框架下 Qwen3.8 Flash Next UD-Q4_K_XL 量化模型性能
reddit.com作者:/u/hyudryu产品AI评分:70/100
作者使用单张 RTX PRO 6000 (96GB) 工作站显卡,测试了 Unsloth 提供的 Qwen3.8-Flash-Next UD-Q4_K_XL 量化模型在 Strata 推理框架下的表现。配置包括 INT8 KV Cache、256K 上下文窗口及 MTP-4 推测解码。结果显示输出速度约为每任务 256 tokens,作者认为相比常见的 IQ2/IQ3 量化版本,该 UD-Q4_K_XL 方案性能令人印象深刻。