AGI Hunt· ChrSzegedy·· 2 小时前AI 评分33
LeanLean 基准测 LLM 压缩 Lean 证明,Opus 5.5 得 64.3% 领跑
AI 导读
新基准 LeanLean 用于评估 LLM 压缩 Lean 代码库的能力,Opus 5.5 以 64.3% 的得分大幅领先,GPT 6.1 Sol 仅 39.9%。该基准的背景是 LLM 生成的数学证明越来越长,Claude 证明费马大定理的 Lean 代码已达 1300 万行。
来源:AGI Hunt · agihunt.info