跳到正文
热点事件持续更新

vLLM 长上下文推理实测比 llama.cpp 快约百倍

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

长上下文推理场景下 vLLM 与 llama.cpp 的性能差距引发关注。据 AGI Hunt 报道,@NicWAI 进行了长上下文推理实测,vLLM 官方账号随后转评该测试:在双 RTX 5090 上跑同一模型,vLLM 达到 110 tokens/s;而 llama.cpp 在单张 RTX 5090 上跑长上下文时,首个 token 等待约 30 分钟。报道据此称两者性能差约 100 倍。报道标题表述为“同款 RTX 5090”,正文则显示 vLLM 侧使用双卡、llama.cpp 侧使用单卡。目前该实测由第三方完成、vLLM 官方转发背书,报道未提供同等硬件配置下的对照测试信息。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    vLLM 官方转评实测:同款 RTX 5090 长上下文推理性能差约 100 倍

    vLLM 官方账号转评 @NicWAI 的长上下文推理实测:双 RTX 5090 上跑同一模型,vLLM 达到 110 tokens/s,而 llama.cpp 在单张 5090 上长上下文首 token 等了约 30 分钟,性能差约 100 倍。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。