AGI Hunt· SouthernUniversityofScienceandTechnology·· 6 小时前AI 评分46
南科大提出 ActFirst-OPD:先行动后思考,多轮智能体蒸馏训练提速最高 4.9 倍
南科大 ActFirst-OPD:先行动后思考,多轮智能体蒸馏训练提速最高 4.9 倍
AI 导读
南科大提出 ActFirst-OPD,让智能体先行动、偏离参考轨迹时切回自主预测,解决在线策略蒸馏(OPD)中长推理阻塞环境交互的问题。在 0.6B/1.7B/4B Qwen3 上,ALFWorld 平均提速 2.3 倍、WebShop 1.8 倍、ScienceWorld 4.9 倍。9 组基准-模型设置中 8 组成功率持平或超越 OPD 基线。
来源:AGI Hunt · agihunt.info