← 返回信息流

Reddit r/LocalLLaMA短讯

Qwen3.8 27B 在 12GB Ampere 显卡上的优化:支持 200K 上下文与 MTP

reddit.com作者:/u/Brief-Tap-6616模型AI评分:50/100

作者针对 NVIDIA 12GB 显存显卡(如 RTX 3090)发布了 Qwen3.8 27B 模型的优化版本。该版本引入了多令牌预测(MTP)技术,相比前代速度提升约 3-4%,运行时内存占用减少数百 MB。在使用 YaRN 技术时,上下文窗口支持扩展至约 340K tokens。主要面向此前未被重点关注的 12GB 显存用户群体,包含一系列可配置的运行时调整。

阅读原文