AGI Hunt· textql·· 2 小时前AI 评分48
TextQL 发布 Argo-Bench:235 表企业级仓库考数据 agent,最强模型仅 34.8% 任务达标
Argo-Bench:235 表企业级仓库考数据 agent,最强模型仅 34.8% 任务达标
AI 导读
TextQL 发布 Argo-Bench,一个超越 text-to-SQL 的企业级数据 agent 评测框架,含 210 个数据科学与分析任务和一套 235 张表、75 亿行的仿真数据仓库。agent 需先在仓库中导航重建事实,再执行封禁欺诈账号、分配骑手激励预算等动作,按动作在仿真器中的后果评分。14 个前沿与开源模型中最强者仅 34.8% 任务拿到 95 分以上,平均 59.5 分。
来源:AGI Hunt · agihunt.info