跳到正文
热点事件持续更新

Strata 在 16GB 单卡本地跑 125B 模型

2 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月1日,AGI Hunt 报道,安全研究者 evilsocket 演示用开源推理引擎 Strata,在单块 16GB 显存的 NVIDIA 显卡上本地运行 125B 参数的 Qwen3.8-Flash-Next 模型,采用 IQ1M 量化。同日 21:14 的另一篇报道则把这一演示描述为在 16GB 显存的 NVIDIA GPU 上运行 IQ1M 极致量化版的 qwen3.8-flash-next-coder,强调激进量化让消费级显卡也能本地跑大参数编码模型;两篇报道对模型的称呼并不一致,早先报道称 Qwen3.8-Flash-Next,后续报道称 Qwen3.8 Coder / qwen3.8-flash-next-coder,其余条件(Strata 引擎、单卡 16GB、125B 参数、IQ1M 量化、evilsocket 演示)一致。该事件关注的组合是“小显存跑大模型”。报道均未给出推理速度、上下文长度、实际显存占用或精度损失等指标,也未说明是否借助内存卸载等机制。截至目前,公开信息仍停留在该次演示层面,尚无更多复现记录或官方说明。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. AGI Hunt
    开源推理引擎 Strata 在 16GB 显存单卡本地运行 125B 的 Qwen3.8-Flash-Next

    evilsocket 演示用开源推理引擎 Strata 在单块 16GB NVIDIA 显卡上运行 125B 参数的 Qwen3.8-Flash-Next(IQ1M 量化)。

  2. AGI Hunt
    16GB 老显卡跑 Qwen3.8 Coder,Strata 极致量化显神通

    安全研究者 evilsocket 演示用 Strata 在一张 16GB 显存的 NVIDIA GPU 上运行 IQ1M 极致量化版 qwen3.8-flash-next-coder。这种激进量化让消费级显卡也能本地跑大参数编码模型,是端侧部署玩家的实用玩法。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。