跳到正文
原文
AGI Hunt· paul_cal·· 3 小时前AI 评分38

Paul Cal 质疑 BridgeMind 用 30 任务新基准对比 Opus 旧 6 任务成绩

Paul Cal 甚至质疑 BridgeMind 用 30 任务新基准对比旧 6 任务成绩

AI 导读

Paul Cal 批评 BridgeMind 的 Opus 测试:新 Opus 用 30 个任务,而此前 Opus 4.6 分数仅基于 6 个任务,两者不是同一基准,直接对比没有意义。6 个共同任务上今天得分 85.4%、此前 87.6%,波动主要来自一次未重复验证的 fabrication 案例,属统计噪声范围。他称该行为是「卑鄙的蹭热度」,并明确表示 BridgeMind 不是可靠的信息来源。

来源:AGI Hunt · agihunt.info