跳到正文
热点事件持续更新

AREX-2:长程反思任务提升自改进智能体

2 篇报道2 个报道来源7 小时前更新

先了解这件事

AI 综述

2026年10月1日,arXiv cs.AI 刊出 AREX-2,该工作通过从机器学习与算法编程任务中合成长期改进轨迹,提升 LLM 智能体在测试时迭代优化答案的能力,智能体基于 Qwen3.8-27B 构建。报道称,AREX-2 在 MLE-bench Lite 与 Frontier-CS 上分别取得 81.8 和 70.7,并可迁移至深度研究任务,在 BrowseComp、HLE、GAIA、DeepSearchQA 上分别为 84.0、52.6、92.2 和 93.8。同日稍晚,AGI Hunt 报道称 AREX-2 由 BAAI 发布,并给出方法定位上的补充:该工作瞄准 LLM 智能体的测试时自我改进能力,将其拆解为反思与长程执行两种能力,并假设这两种能力与领域无关、可在反馈可验证的领域习得。早先的 arXiv 报道未提及发布机构,后续报道称发布方为 BAAI;两篇报道在 MLE-bench Lite、Frontier-CS 及四项深度研究任务的分值上一致。此前该事件以“长程反思任务提升自改进智能体”为线索持续跟踪,本次为新论文、机构归属与具体评测结果的公开。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. AGI Hunt
    BAAI 发布 AREX-2,用长程反思数据训练自我改进智能体,GAIA 达 92.2

    BAAI 发布 AREX-2,瞄准 LLM 智能体的测试时自我改进能力,将其拆解为反思与长程执行两种能力,并假设二者与领域无关、可在反馈可验证的领域习得。

  2. arXiv cs.AI
    AREX-2:用长时程反思任务推进自我改进智能体

    AREX-2 通过从机器学习与算法编程任务中合成长期改进轨迹,提升 LLM 智能体在测试时迭代优化答案的能力,智能体基于 Qwen3.8-27B 构建。它在 MLE-bench Lite 和 Frontier-CS 上分别取得 81.8 与 70.7,并迁移至深度研究任务:BrowseComp 84.0、HLE 52.6、GAIA 92.2、DeepSearchQA 93.8。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。