AGI Hunt· bo_wangbo·· 4 小时前AI 评分27
博主自建盲测:pplx-decider-1.1 与前沿模型一致率达 95.6%
博主自建盲测:pplx-decider-1.1 与前沿模型一致率达 95.6%
AI 导读
博主 bowangbo 自建盲测对比 pplx-decider-1.1 与前沿模型的答案一致率,其模型达到 95.6%。实验用 Critic(Ops 5.5)跨 4 个领域生成 1000 个问题及选项,让 Astra 6.1 作为前沿模型作答,再比较各家与前沿答案的一致率。jev113 的一致率为 92.8%,额外敏感性检查显示结果非常稳定。
来源:AGI Hunt · agihunt.info