热点事件持续更新
Legal Research Bench:法律研究智能体可靠性评测
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月2日,arXiv cs.AI 刊出 Legal Research Bench(LRB)。该基准包含 413 道由专家编写的美国法律研究问题,采用全通过(all-pass)评分并结合来源核验,用以衡量法律研究智能体的端到端可靠性。报道称,在 13 个前沿模型中表现最好的 Claude Opus 4.8,完全正确率仅为 42.9%。此外,更多轮次、工具调用与推理成本并不预示更高准确率;需要协调冲突权威的题目得分更低。
AI 根据报道生成 · 1 小时前更新
最新进展10月2日 12:00
LRB 发布:13 个前沿模型中最优者完全正确率仅 42.9%。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv cs.AILegal Research Bench:衡量长程法律研究智能体的端到端可靠性
Legal Research Bench(LRB)包含 413 道专家编写的美国法律研究问题,以全通过评分和来源核验衡量法律研究智能体的端到端可靠性。在 13 个前沿模型中表现最好的 Claude Opus 4.8 完全正确率仅 42.9%。更多轮次、工具调用与推理成本并不预示更高准确率,需协调冲突权威的题目得分更低。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。