跳到正文
原文
AGI Hunt· kalyan_kpl·· 2 小时前AI 评分44

MLflow 实测:GPT-OSS-120B 作 LLM 评审 72/72 全对,压过专用模型 Jev

MLflow 实测:GPT-OSS-120B 作 LLM 评审 72/72 全对,压过专用模型 Jev

AI 导读

Databricks 实测中,GPT-OSS-120B 作 LLM judge 在英文日文双语共 72 个答案上 72/72 全对,压过 TypeSafe 专用结构化判断模型 Jev(typesafe/jev-1.13)。

来源:AGI Hunt · agihunt.info