热点事件持续更新
TextQL 发布 Argo-Bench 数据 agent 评测基准
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月2日,TextQL 发布企业级数据 agent 评测框架 Argo-Bench,定位为超越 text-to-SQL 的评测方案。该基准包含 210 个数据科学与分析任务,并配套一套 235 张表、75 亿行的仿真数据仓库。与只考核取数的 text-to-SQL 不同,agent 需要先在仓库中导航、重建事实,再执行封禁欺诈账号、分配骑手激励预算等动作,最终按动作在仿真器中的后果评分。TextQL 用 14 个前沿与开源模型做了测试:最强的模型也仅有 34.8% 的任务拿到 95 分以上,平均得分 59.5 分。
AI 根据报道生成 · 1 小时前更新
最新进展10月2日 13:17
Argo-Bench 测试结果公布:14 个模型中最强者仅 34.8% 任务达标,平均 59.5 分。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AGI HuntTextQL 发布 Argo-Bench:235 表企业级仓库考数据 agent,最强模型仅 34.8% 任务达标
TextQL 发布 Argo-Bench,一个超越 text-to-SQL 的企业级数据 agent 评测框架,含 210 个数据科学与分析任务和一套 235 张表、75 亿行的仿真数据仓库。agent 需先在仓库中导航重建事实,再执行封禁欺诈账号、分配骑手激励预算等动作,按动作在仿真器中的后果评分。14 个前沿与开源模型中最强者仅 34.8% 任务拿到 95 分以上,平均 59.5 分。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。