跳到正文
热点事件持续更新

AutoDataBench:评测 Agent 自造训练数据能力

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

AutoDataBench 是以数据工业交付标准衡量 Agent 自主合成可验证训练任务能力的新基准,评测在三个可执行 Agent 基准上进行。据报道,在默认 45 分钟预算内,没有任何 Agent 得分超过 20/100;若给最强 Agent 四倍时间,得分可显著提升,而单个可用任务的成本几乎不变。报道称,现有 Agent 已能写出合格的训练任务,但效率不足。该基准的代码与数据已开源。目前尚无其他后续进展。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. AGI Hunt
    AutoDataBench:Agent 自造训练数据质量尚可,45 分钟内得分不足 20/100

    AutoDataBench 用数据工业交付标准评测 Agent 自主合成可验证训练任务的能力:在三个可执行 Agent 基准上,默认 45 分钟预算内无一 Agent 得分超过 20/100。给最强 Agent 四倍时间可显著提分,单个可用任务成本几乎不变。现有 Agent 能写出合格训练任务,但效率不足,代码与数据已开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。