跳到正文
原文
arXiv cs.AI· Katrina Drozdov, Oliver Chen, Langston Nashold, Rayan Krishnan·· 4 小时前AI 评分47

Legal Research Bench:衡量长程法律研究智能体的端到端可靠性

Legal Research Bench: Measuring End-to-End Reliability in Long-Horizon Legal Research Agents

AI 导读

Legal Research Bench(LRB)包含 413 道专家编写的美国法律研究问题,以全通过评分和来源核验衡量法律研究智能体的端到端可靠性。在 13 个前沿模型中表现最好的 Claude Opus 4.8 完全正确率仅 42.9%。更多轮次、工具调用与推理成本并不预示更高准确率,需协调冲突权威的题目得分更低。

来源:arXiv cs.AI · arxiv.org