AGI Hunt· kalyan_kpl·· 2 小时前AI 评分44
MLflow 实测:GPT-OSS-120B 作 LLM 评审 72/72 全对,压过专用模型 Jev
MLflow 实测:GPT-OSS-120B 作 LLM 评审 72/72 全对,压过专用模型 Jev
AI 导读
Databricks 实测中,GPT-OSS-120B 作 LLM judge 在英文日文双语共 72 个答案上 72/72 全对,压过 TypeSafe 专用结构化判断模型 Jev(typesafe/jev-1.13)。
来源:AGI Hunt · agihunt.info