AGI Hunt· vllm_project·· 3 小时前AI 评分61
vLLM 官方转评实测:同款 RTX 5090 长上下文推理性能差约 100 倍
同款 RTX 5090 推理差百倍:vLLM 官方证实引擎比硬件更关键
AI 导读
vLLM 官方账号转评 @NicWAI 的长上下文推理实测:双 RTX 5090 上跑同一模型,vLLM 达到 110 tokens/s,而 llama.cpp 在单张 5090 上长上下文首 token 等了约 30 分钟,性能差约 100 倍。
来源:AGI Hunt · agihunt.info