Reddit r/LocalLLaMA短讯中文原文我将 Qwen3.8-27B 在 RTX 3090 上推至单请求 381 tps2 小时前reddit.com作者:/u/iamMess教程评测AI评分:70/100作者发布了一个针对 RTX 3090 的超优化 Qwen3.8-27B 推理引擎,单请求速度从 82 tps 提升至 381 tps。通过使用 fp8 KV 缓存、int8 激活、DFlash2 块草拟等技术,实现了文档引用工作负载的 15/16 token 接受率。阅读原文