跳到正文
热点事件持续更新

Ninfer 推理后端 Blackwell 实测 130-180 t/s

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026 年 10 月 2 日,AGI Hunt 报道称,有 Reddit 用户对新推理后端 Ninfer 进行了实测。测试在 Blackwell MaxQ GPU 上进行,运行 qwen3.8-27b-nvfp4 模型,并采用 Dflash2、MTP-7 配置,最终跑出 130-180 tokens/s 的推理速度。报道称,这一成绩远快于 llama-server。目前该消息来源为用户实测并经媒体转述,报道中未给出官方基准数据或更多复现结果。就可确认的信息看,Ninfer 的主要卖点是 Blackwell 平台上的推理吞吐,以及相对 llama-server 的速度优势;至于该成绩在其他硬件、模型与配置下是否成立,尚无报道涉及。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AGI Hunt
    Ninfer 在 Blackwell 上实测 130-180 t/s,远快于 llama-server

    Reddit 用户实测新推理后端 Ninfer:在 Blackwell MaxQ GPU 上以 qwen3.8-27b-nvfp4(Dflash2、MTP-7 配置)跑出 130-180 tokens/s,远快于 llama-server。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。