VLM Run 实测:文档处理 VLM 延迟远优于 OCR
先了解这件事
2026 年 10 月 2 日,AGI Hunt 报道 VLM Run 团队基于 TypeSafe 兼容的 SystemOne API 开展实测,对比文档处理管线中的 VLM 方案与 OCR→文本方案。token 消耗方面,基于 VLM 的文档分类每页固定消耗约 372 tokens,OCR→文本方案中位数约 2002 tokens,token 效率高出约 7 倍以上;OCR 最差页高达 19159 tokens。延迟方面,报道称规模化时决定成败的是长尾而非均值:VLM 的 p90 端到端延迟为 209ms,OCR→文本方案为 1453ms。报道据此指出,批处理容量可按每页 372 tokens 规划,VLM 的固定消耗让容量规划变得可预测,而 OCR 方案不可预测的尾部才是规模化时的真正瓶颈。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- AGI HuntVLM Run 实测:规模化会输在尾部,VLM p90 延迟 209ms、OCR 达 1453ms
VLM Run 实测显示,文档处理管线规模化时决定成败的是长尾而非均值:VLM 的 p90 端到端延迟为 209ms,OCR→文本方案为 1453ms。VLM 每页固定消耗约 372 tokens,OCR→文本中位数为 2002 tokens,最差页高达 19159 tokens。因此批处理容量可按每页 372 tokens 规划,而 OCR 方案不可预测的尾部才是规模化时的真正瓶颈。
- AGI HuntVLM Run 实测:文档分类中 VLM 方案比 OCR 省约 7 倍 token
VLM Run 团队用 TypeSafe 兼容的 SystemOne API 做对比测试,基于 VLM 的文档分类每页固定消耗约 372 tokens,OCR 转文本方案中位数约 2002 tokens,整体 token 效率高出约 7 倍以上。OCR 方案最差页达 19159 tokens,而 VLM 的固定消耗让容量规划变得可预测。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。