跳到正文
热点事件持续更新

LeanLean 基准发布,Opus 5.5 以 64.3% 领跑

1 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

2026 年 10 月 7 日,AGI Hunt 报道,新基准 LeanLean 发布,用于评估 LLM 压缩 Lean 代码库的能力。据该报道,Opus 5.5 在 LeanLean 上以 64.3% 的得分大幅领先,GPT 6.1 Sol 仅得 39.9%。报道同时给出该基准的背景:LLM 生成的数学证明越来越长,Claude 证明费马大定理的 Lean 代码已达 1300 万行。目前尚无更多关于该基准评测细节或后续刷新的报道。

AI 根据报道生成 · 57 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    LeanLean 基准测 LLM 压缩 Lean 证明,Opus 5.5 得 64.3% 领跑

    新基准 LeanLean 用于评估 LLM 压缩 Lean 代码库的能力,Opus 5.5 以 64.3% 的得分大幅领先,GPT 6.1 Sol 仅 39.9%。该基准的背景是 LLM 生成的数学证明越来越长,Claude 证明费马大定理的 Lean 代码已达 1300 万行。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。