跳到正文
热点事件持续更新

南科大提出ActFirst-OPD多轮智能体蒸馏框架

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

2026年9月30日报道,南方科技大学提出ActFirst-OPD多轮智能体蒸馏框架。该方法让智能体先行动、后思考,在偏离参考轨迹时切回自主预测,以解决在线策略蒸馏(OPD)中长推理阻塞环境交互的问题。研究在0.6B、1.7B、4B规模的Qwen3模型上验证,ALFWorld平均提速2.3倍,WebShop平均提速1.8倍,ScienceWorld平均提速4.9倍。在9组基准-模型设置中,有8组成功率与OPD基线持平或实现超越。

AI 根据报道生成 · 5 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. AGI Hunt
    南科大提出 ActFirst-OPD:先行动后思考,多轮智能体蒸馏训练提速最高 4.9 倍

    南科大提出 ActFirst-OPD,让智能体先行动、偏离参考轨迹时切回自主预测,解决在线策略蒸馏(OPD)中长推理阻塞环境交互的问题。在 0.6B/1.7B/4B Qwen3 上,ALFWorld 平均提速 2.3 倍、WebShop 1.8 倍、ScienceWorld 4.9 倍。9 组基准-模型设置中 8 组成功率持平或超越 OPD 基线。

本事件热度走势

当前热度 9·可比范围峰值 10(9月30日 11:00)·近 24 小时可比范围变化 –

02.557.5109月30日11:009月30日12:009月30日14:009月30日15:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。