热点事件持续更新
Ninfer 推理后端 Blackwell 实测 130-180 t/s
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026 年 10 月 2 日,AGI Hunt 报道称,有 Reddit 用户对新推理后端 Ninfer 进行了实测。测试在 Blackwell MaxQ GPU 上进行,运行 qwen3.8-27b-nvfp4 模型,并采用 Dflash2、MTP-7 配置,最终跑出 130-180 tokens/s 的推理速度。报道称,这一成绩远快于 llama-server。目前该消息来源为用户实测并经媒体转述,报道中未给出官方基准数据或更多复现结果。就可确认的信息看,Ninfer 的主要卖点是 Blackwell 平台上的推理吞吐,以及相对 llama-server 的速度优势;至于该成绩在其他硬件、模型与配置下是否成立,尚无报道涉及。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AGI HuntNinfer 在 Blackwell 上实测 130-180 t/s,远快于 llama-server
Reddit 用户实测新推理后端 Ninfer:在 Blackwell MaxQ GPU 上以 qwen3.8-27b-nvfp4(Dflash2、MTP-7 配置)跑出 130-180 tokens/s,远快于 llama-server。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。