AGI Hunt· spillai·· 2 小时前AI 评分42
VLM Run 实测:规模化会输在尾部,VLM p90 延迟 209ms、OCR 达 1453ms
规模化会输在尾部:VLM p90 延迟 209ms,OCR 达 1453ms
AI 导读
VLM Run 实测显示,文档处理管线规模化时决定成败的是长尾而非均值:VLM 的 p90 端到端延迟为 209ms,OCR→文本方案为 1453ms。VLM 每页固定消耗约 372 tokens,OCR→文本中位数为 2002 tokens,最差页高达 19159 tokens。因此批处理容量可按每页 372 tokens 规划,而 OCR 方案不可预测的尾部才是规模化时的真正瓶颈。
来源:AGI Hunt · agihunt.info