GPT-6.1 Sol MazeBench 仅得 9%
先了解这件事
2026年10月2日,AGI Hunt 报道称,在 3D 开放世界视觉空间推理基准 MazeBench 上,GPT-6.1 Sol 仅得 9%,略高于(险胜)Claude Opus 5.5。与上一代 GPT-6 Astra 相比,Sol 保留了解谜能力,但成本降至其 10%。同日报道称,Sol 能解 2D 谜题,但 3D 谜题明显吃力:其 agent 倾向从俯视角度观察世界,只在万不得已时才旋转相机,这在入门级 3D 谜题上够用,但很快会阻碍后续进展。同日另有报道称,MazeBench 已免费开放在线试玩,排行榜同步上线,支持 Google/GitHub/X 登录;作者观察到新模型在 2D 解谜上已很熟练,在 3D 场景则明显吃力。报道未披露双方的具体得分细节。
AI 根据报道生成 · 2 小时前更新
事件进展
- 10月2日 00:23 · 1 篇报道MazeBench 3D 空间推理基准免费开放试玩AGI Hunt:MazeBench 免费上线:AI Agent 玩 3D 迷宫普遍不爱转镜头
- 10月2日 00:23 · 2 篇报道GPT-6.1 Sol MazeBench 仅得 9%AGI Hunt:GPT-6.1 Sol 在 MazeBench 仅得 9%,险胜 Claude Opus 5.5
报道时间线
沿着报道,了解事件的不同侧面。
- AGI HuntMazeBench 免费上线:AI Agent 玩 3D 迷宫普遍不爱转镜头
3D 开放世界视觉空间推理基准 MazeBench 现已免费开放在线试玩,排行榜同步上线,支持 Google/GitHub/X 登录。作者观察发现,新模型在 2D 解谜上已很熟练,但在 3D 场景明显吃力:agent 偏好俯视角看世界,只在万不得已时才旋转相机,这在入门级 3D 谜题上还行,但很快就会卡住进度。
- AGI HuntGPT-6.1 Sol 3D 谜题翻车:agent 偏爱俯视,不爱转镜头
对 GPT-6.1 Sol 的行为观察显示,它能解 2D 谜题,但 3D 谜题明显吃力,在 MazeBench 上仅得 9%,险胜 Claude Opus 5.5。该 agent 倾向从俯视角度观察世界,只在万不得已时才旋转相机,这在入门级 3D 谜题上够用,但很快会阻碍后续进展。
- AGI HuntGPT-6.1 Sol 在 MazeBench 仅得 9%,险胜 Claude Opus 5.5
MazeBench 测试结果显示,GPT-6.1 Sol 仅得 9%,略高于 Claude Opus 5.5。与上一代 GPT-6 Astra 相比,Sol 保留了解谜能力,但成本降至其 10%。另有测试指出,GPT-6.1 Sol 在 3D 谜题中 agent 偏爱俯视、不爱转镜头。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。