单卡 RTX 5090 本地实测 Qwen3.8 Flash Next
先了解这件事
2026年10月1日,AGI Hunt 报道称,日本用户使用本地推理工具 Strata 实测体积 87GB 的 Qwen3.8 Flash Next,在单张 RTX 5090 上以 150 t/s 解码、Prefill 达 4K t/s;该模型接入 LibreChat 并开启 Web 搜索后可正常检索,护栏较为宽松,评论认为「需要数据中心」的说法受到冲击,Qwen 级模型已成桌面级玩法。10月2日,AGI Hunt 再报道称,一名 Reddit 用户在功率受限的 RTX 5090 配 96GB DDR5-6400 内存的机器上,用 Strata 运行 IQ3S 量化的 Qwen3.8-Flash-Next,在 128k 上下文(8-bit KV cache)下解码达 150-200 tok/s,预填充 5-6k tok/s,靠部分 offload 到内存实现长上下文运行。两则报道的测试者、模型精度与硬件配置均不同:早先报道为 87GB 原模型、Prefill 4K t/s,后续报道为 IQ3S 量化版本、预填充 5-6k tok/s。目前尚无官方回应或其他来源的独立复现。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- AGI Hunt功率受限 5090 配 96GB 内存:Qwen3.8-Flash 本地跑出 200 tok/s
Reddit 用户实测,功率受限的 RTX 5090 配 96GB DDR5-6400 内存,用 Strata 运行 IQ3S 量化的 Qwen3.8-Flash-Next,在 128k 上下文(8-bit KV cache)下解码达 150-200 tok/s,预填充 5-6k tok/s。说明即使显存受限、靠部分 offload 到内存,本地也能跑长上下文大模型且速度可用。
- AGI Hunt87GB 大模型 Qwen3.8 Flash Next 单卡 RTX 5090 跑到 150 t/s
87GB 的 Qwen3.8 Flash Next 由日本用户用本地推理工具 Strata 实测,在单张 RTX 5090 上以 150 t/s 运行,Prefill 达 4K t/s。该模型接入 LibreChat 并开启 Web 搜索后可正常检索,且护栏宽松。评论认为「需要数据中心」的时代受到冲击,Qwen 级模型已成桌面级玩法。
本事件热度走势
当前热度 10·可比范围峰值 10(10月3日 00:00)·近 24 小时可比范围变化 +35%
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。