arXiv cs.CL· Alexander Gill, Md Farhan Ishmam, Xuyen Nguyen, Neha Bhat, Parker Henry DeYoung, Fateme Hashemi Chaleshtori, Nathan Stringham, Kenneth Marino, Ana Marasovi\'c·· 2 天前AI 评分41
KNOWS:搜索之后的难事——基准评测 Web Agent 的知识综合、组织与展示
The Hard Part Comes After Search: Benchmarking Web Agents on Synthesizing, Organizing, and Displaying Knowledge
AI 导读
KNOWS 基准用开放式复杂浏览器任务评测 computer-use 智能体能否跨多步检索信息、综合成文档/演示文稿/表格等成品。任务配有结合确定性检查与 LLM 判定的 evaluator;最佳智能体完全成功不到 3% 的复杂长程任务,视觉步骤失败还会让成品不可用。
来源:arXiv cs.CL · arxiv.org