跳到正文
原文
AGI Hunt· z0_o6·· 3 小时前AI 评分44

功率受限 5090 配 96GB 内存:Qwen3.8-Flash 本地跑出 200 tok/s

AI 导读

Reddit 用户实测,功率受限的 RTX 5090 配 96GB DDR5-6400 内存,用 Strata 运行 IQ3S 量化的 Qwen3.8-Flash-Next,在 128k 上下文(8-bit KV cache)下解码达 150-200 tok/s,预填充 5-6k tok/s。说明即使显存受限、靠部分 offload 到内存,本地也能跑长上下文大模型且速度可用。

来源:AGI Hunt · agihunt.info