arXiv cs.AI· Hongjin Qian, Chaofan Li, Kun Luo, Wenqing Wei, Jianlyu Chen, Shuqi Lu, Yuyang Hu, Hongwang Xiao, Hui Wang, Chaozhuo Li, Qiwei Ye, Zhicheng Dou, Defu Lian, Zheng Liu·· 8 小时前AI 评分50
AREX-2:用长时程反思任务推进自我改进智能体
AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks
AI 导读
AREX-2 通过从机器学习与算法编程任务中合成长期改进轨迹,提升 LLM 智能体在测试时迭代优化答案的能力,智能体基于 Qwen3.8-27B 构建。它在 MLE-bench Lite 和 Frontier-CS 上分别取得 81.8 与 70.7,并迁移至深度研究任务:BrowseComp 84.0、HLE 52.6、GAIA 92.2、DeepSearchQA 93.8。
来源:arXiv cs.AI · arxiv.org