跳到正文
原文
AGI Hunt· vllm_project·· 3 小时前AI 评分61

vLLM 官方转评实测:同款 RTX 5090 长上下文推理性能差约 100 倍

同款 RTX 5090 推理差百倍:vLLM 官方证实引擎比硬件更关键

AI 导读

vLLM 官方账号转评 @NicWAI 的长上下文推理实测:双 RTX 5090 上跑同一模型,vLLM 达到 110 tokens/s,而 llama.cpp 在单张 5090 上长上下文首 token 等了约 30 分钟,性能差约 100 倍。

来源:AGI Hunt · agihunt.info