跳到正文
原文
arXiv cs.AI· Hongjin Qian, Chaofan Li, Kun Luo, Wenqing Wei, Jianlyu Chen, Shuqi Lu, Yuyang Hu, Hongwang Xiao, Hui Wang, Chaozhuo Li, Qiwei Ye, Zhicheng Dou, Defu Lian, Zheng Liu·· 8 小时前AI 评分50

AREX-2:用长时程反思任务推进自我改进智能体

AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks

AI 导读

AREX-2 通过从机器学习与算法编程任务中合成长期改进轨迹,提升 LLM 智能体在测试时迭代优化答案的能力,智能体基于 Qwen3.8-27B 构建。它在 MLE-bench Lite 和 Frontier-CS 上分别取得 81.8 与 70.7,并迁移至深度研究任务:BrowseComp 84.0、HLE 52.6、GAIA 92.2、DeepSearchQA 93.8。

来源:arXiv cs.AI · arxiv.org