跳到正文
热点事件持续更新

Legal Research Bench:法律研究智能体可靠性评测

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月2日,arXiv cs.AI 刊出 Legal Research Bench(LRB)。该基准包含 413 道由专家编写的美国法律研究问题,采用全通过(all-pass)评分并结合来源核验,用以衡量法律研究智能体的端到端可靠性。报道称,在 13 个前沿模型中表现最好的 Claude Opus 4.8,完全正确率仅为 42.9%。此外,更多轮次、工具调用与推理成本并不预示更高准确率;需要协调冲突权威的题目得分更低。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv cs.AI
    Legal Research Bench:衡量长程法律研究智能体的端到端可靠性

    Legal Research Bench(LRB)包含 413 道专家编写的美国法律研究问题,以全通过评分和来源核验衡量法律研究智能体的端到端可靠性。在 13 个前沿模型中表现最好的 Claude Opus 4.8 完全正确率仅 42.9%。更多轮次、工具调用与推理成本并不预示更高准确率,需协调冲突权威的题目得分更低。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。