热点事件持续更新
vLLM 长上下文推理实测比 llama.cpp 快约百倍
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
长上下文推理场景下 vLLM 与 llama.cpp 的性能差距引发关注。据 AGI Hunt 报道,@NicWAI 进行了长上下文推理实测,vLLM 官方账号随后转评该测试:在双 RTX 5090 上跑同一模型,vLLM 达到 110 tokens/s;而 llama.cpp 在单张 RTX 5090 上跑长上下文时,首个 token 等待约 30 分钟。报道据此称两者性能差约 100 倍。报道标题表述为“同款 RTX 5090”,正文则显示 vLLM 侧使用双卡、llama.cpp 侧使用单卡。目前该实测由第三方完成、vLLM 官方转发背书,报道未提供同等硬件配置下的对照测试信息。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 11:05
vLLM 官方转评实测:110 tokens/s 对 llama.cpp 首 token 等待约 30 分钟。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI HuntvLLM 官方转评实测:同款 RTX 5090 长上下文推理性能差约 100 倍
vLLM 官方账号转评 @NicWAI 的长上下文推理实测:双 RTX 5090 上跑同一模型,vLLM 达到 110 tokens/s,而 llama.cpp 在单张 5090 上长上下文首 token 等了约 30 分钟,性能差约 100 倍。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。