跳到正文
原文
AGI Hunt· dl_weekly·· 4 小时前AI 评分38

生产实测:Jev 做 LLM 裁判比 GPT-4o-mini 便宜 3.5 倍、快 3.8 倍

AI 导读

在 1,000 条真实生产对话上,Jev 作为 LLM 裁判的中位耗时比 GPT-4o-mini 快 3.8 倍、成本低 3.5 倍,两者在 89.7% 的评估上结论一致。这项生产环境对比面向需要大规模 LLM-as-judge 评测管线的团队,可直接作为降本参考。

来源:AGI Hunt · agihunt.info