Reddit r/LocalLLaMA短讯
Qwen3.8-27B 在单张 RTX 3090 上实现 140 tok/s:Megakernel CUDA 内核性能更新与精度对比
reddit.com作者:/u/Adorable_Weakness_39教程AI评分:50/100
作者发布 Qwen3.8-27B 的专用 CUDA Megakernel 引擎后续更新。该引擎在单张 RTX 3090 上推理速度比 llama.cpp 快 1.4-1.9 倍,KL 散度仅为 0.0009,验证了高精度与高性能。提供了代码仓库及基准测试链接。