跳到正文
热点事件持续更新

Harvey 法律 Agent 基准被指评分数据不一致

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Harvey 的 Legal Agent Benchmark(法律 Agent 基准)于 2026-09-29 更新,任务覆盖反垄断、并购、破产等数十个法律领域。2026-10-01,有研究者在核对该基准时发现数据不一致:Harvey 自己的报告称 Argon 得分为 19.6%,而第三方榜单 vals.ai 显示 Argon 为 25.42%,同一模型出现两个不同分数。报道同时提到,该基准上 Muse Spark 1.2 等模型表现领先,Astra 等则大幅落后。目前公开报道只呈现了两个来源的数字差异,未说明差异产生的原因,也未提及 Harvey 或 vals.ai 的进一步回应。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. AGI Hunt
    Harvey 法律基准现数据打架:Argon 19.6% 对 25.42%

    有研究者核对 Harvey 的 Legal Agent Benchmark 时发现数据不一致,其报告称 Argon 得分 19.6%,第三方榜单 vals.ai 显示 Argon 为 25.42%。Muse Spark 1.2 等模型表现领先,Astra 等大幅落后。该基准 2026-09-29 更新,覆盖反垄断、并购、破产等数十个法律领域任务。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。