跳到正文
热点事件持续更新

TextQL 发布 Argo-Bench 数据 agent 评测基准

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月2日,TextQL 发布企业级数据 agent 评测框架 Argo-Bench,定位为超越 text-to-SQL 的评测方案。该基准包含 210 个数据科学与分析任务,并配套一套 235 张表、75 亿行的仿真数据仓库。与只考核取数的 text-to-SQL 不同,agent 需要先在仓库中导航、重建事实,再执行封禁欺诈账号、分配骑手激励预算等动作,最终按动作在仿真器中的后果评分。TextQL 用 14 个前沿与开源模型做了测试:最强的模型也仅有 34.8% 的任务拿到 95 分以上,平均得分 59.5 分。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AGI Hunt
    TextQL 发布 Argo-Bench:235 表企业级仓库考数据 agent,最强模型仅 34.8% 任务达标

    TextQL 发布 Argo-Bench,一个超越 text-to-SQL 的企业级数据 agent 评测框架,含 210 个数据科学与分析任务和一套 235 张表、75 亿行的仿真数据仓库。agent 需先在仓库中导航重建事实,再执行封禁欺诈账号、分配骑手激励预算等动作,按动作在仿真器中的后果评分。14 个前沿与开源模型中最强者仅 34.8% 任务拿到 95 分以上,平均 59.5 分。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。