热点事件持续更新
博主盲测:pplx-decider-1.1 与前沿模型一致率 95.6%
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026 年 10 月 7 日,AGI Hunt 报道称,博主 bowangbo 自建盲测,对比 pplx-decider-1.1 与前沿模型的答案一致率。实验设计为:用 Critic(Ops 5.5)跨 4 个领域生成 1000 个问题及选项,再由 Astra 6.1 作为前沿模型作答,然后比较各模型答案与前沿答案的一致率。结果显示,pplx-decider-1.1 的一致率达到 95.6%;同一测试中 jev113 的一致率为 92.8%。报道还称,额外敏感性检查显示结果非常稳定。目前该结果来自博主自建的单一测试,报道中未见第三方复现或相关方回应。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 04:00
博主 bowangbo 自建盲测显示,pplx-decider-1.1 与前沿模型答案一致率达 95.6%。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI Hunt博主自建盲测:pplx-decider-1.1 与前沿模型一致率达 95.6%
博主 bowangbo 自建盲测对比 pplx-decider-1.1 与前沿模型的答案一致率,其模型达到 95.6%。实验用 Critic(Ops 5.5)跨 4 个领域生成 1000 个问题及选项,让 Astra 6.1 作为前沿模型作答,再比较各家与前沿答案的一致率。jev113 的一致率为 92.8%,额外敏感性检查显示结果非常稳定。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。