Reddit r/LocalLLaMA短讯
Qwen3.8-27B在单张3090上:使用自定义CUDA Megakernel实现140 tok/s代码生成速度
reddit.com作者:/u/Adorable_Weakness_39教程AI评分:70/100
作者利用Claude Opus 5.5编写了针对Qwen3.8-27B的自定义CUDA megakernel,在RTX 3090硬件上测试显示,其推理速度比llama.cpp快1.4至1.9倍。具体表现为代码生成从73提升至140 tok/s,含4K上下文时从56提升至95 tok/s,预填充处理也显著提升。该成果展示了通过定制内核优化端侧大模型性能的潜力。