跳到正文
热点事件持续更新

ASCENT提出智能体在线测试时训练自蒸馏方法

1 篇报道1 个报道来源7 小时前更新

先了解这件事

AI 综述

ASCENT 提出面向 LLM 智能体的在线测试时训练方法 OaTTT,让智能体在部署的流式任务中直接更新权重,且更新可跨任务持久保留。其做法是保留一份冻结的初始 LLM 副本,用它接收带验证结果的执行轨迹作为特权信息,再把 next-token 分布蒸馏进持久的 LoRA fast weights;过程中无需外部参考答案,也不需要更强的教师模型,并会剔除无效动作轮次。据最新报道,该方法使智能体在部署中凭自蒸馏验证经验让权重持续进化,无需另行再训练。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt
    ASCENT:智能体部署中自蒸馏验证经验,权重持续进化无需再训练

    ASCENT 提出 OaTTT:LLM 智能体在部署流式任务中用带验证结果的执行轨迹在线更新权重,且更新跨任务持久。方法以冻结的初始 LLM 副本接收验证轨迹作为特权信息,把 next-token 分布蒸馏进持久的 LoRA fast weights,无需外部参考答案或更强教师,并剔除无效动作轮次。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。