Reddit r/LocalLLaMA短讯
双卡 CMP 170HX 运行 GLM-5.3-Flash 实测:384K 上下文与 ~90 tok/s 速度及 Qwen3.8 对比
reddit.com作者:/u/Prudent_Appearance71评测AI评分:50/100
作者分享在双张 64GB CMP 170HX 显卡上稳定运行 GLM-5.3-Flash 的配置,支持 384K 上下文且推理速度约 90 tok/s。同时将该模型与同机运行的 Qwen3.8-Flash-Next(AWQ INT4 + FP8 PLE)进行对比,通过 vLLM 基准测试及 DSH 编码/智能体任务评估实际完成时间。