AGI Hunt· dl_weekly·2026-10-06 22:02· 4 小时前AI 评分38生产实测:Jev 做 LLM 裁判比 GPT-4o-mini 便宜 3.5 倍、快 3.8 倍AI 导读在 1,000 条真实生产对话上,Jev 作为 LLM 裁判的中位耗时比 GPT-4o-mini 快 3.8 倍、成本低 3.5 倍,两者在 89.7% 的评估上结论一致。这项生产环境对比面向需要大规模 LLM-as-judge 评测管线的团队,可直接作为降本参考。来源:AGI Hunt · agihunt.info#评测/基准#OpenAI查看事件全部后续