热点事件持续更新
LeanLean 基准发布,Opus 5.5 以 64.3% 领跑
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
2026 年 10 月 7 日,AGI Hunt 报道,新基准 LeanLean 发布,用于评估 LLM 压缩 Lean 代码库的能力。据该报道,Opus 5.5 在 LeanLean 上以 64.3% 的得分大幅领先,GPT 6.1 Sol 仅得 39.9%。报道同时给出该基准的背景:LLM 生成的数学证明越来越长,Claude 证明费马大定理的 Lean 代码已达 1300 万行。目前尚无更多关于该基准评测细节或后续刷新的报道。
AI 根据报道生成 · 57 分钟前更新
最新进展10月7日 06:24
新基准 LeanLean 发布,Opus 5.5 以 64.3% 领跑,GPT 6.1 Sol 仅 39.9%。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI HuntLeanLean 基准测 LLM 压缩 Lean 证明,Opus 5.5 得 64.3% 领跑
新基准 LeanLean 用于评估 LLM 压缩 Lean 代码库的能力,Opus 5.5 以 64.3% 的得分大幅领先,GPT 6.1 Sol 仅 39.9%。该基准的背景是 LLM 生成的数学证明越来越长,Claude 证明费马大定理的 Lean 代码已达 1300 万行。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。