跳到正文
原文
AGI Hunt· ChrSzegedy·· 2 小时前AI 评分33

LeanLean 基准测 LLM 压缩 Lean 证明,Opus 5.5 得 64.3% 领跑

AI 导读

新基准 LeanLean 用于评估 LLM 压缩 Lean 代码库的能力,Opus 5.5 以 64.3% 的得分大幅领先,GPT 6.1 Sol 仅 39.9%。该基准的背景是 LLM 生成的数学证明越来越长,Claude 证明费马大定理的 Lean 代码已达 1300 万行。

来源:AGI Hunt · agihunt.info