AGI Hunt· patience_cave·· 3 小时前AI 评分28
GPT-6.1 Sol 在 MazeBench 仅得 9%,险胜 Claude Opus 5.5
GPT-6.1 Sol 在 MazeBench 仅得 9%,险胜 Claude Opus 5.5
AI 导读
MazeBench 测试结果显示,GPT-6.1 Sol 仅得 9%,略高于 Claude Opus 5.5。与上一代 GPT-6 Astra 相比,Sol 保留了解谜能力,但成本降至其 10%。另有测试指出,GPT-6.1 Sol 在 3D 谜题中 agent 偏爱俯视、不爱转镜头。
来源:AGI Hunt · agihunt.info