热点事件持续更新
ASCENT提出智能体在线测试时训练自蒸馏方法
1 篇报道1 个报道来源7 小时前更新
先了解这件事
AI 综述
ASCENT 提出面向 LLM 智能体的在线测试时训练方法 OaTTT,让智能体在部署的流式任务中直接更新权重,且更新可跨任务持久保留。其做法是保留一份冻结的初始 LLM 副本,用它接收带验证结果的执行轨迹作为特权信息,再把 next-token 分布蒸馏进持久的 LoRA fast weights;过程中无需外部参考答案,也不需要更强的教师模型,并会剔除无效动作轮次。据最新报道,该方法使智能体在部署中凭自蒸馏验证经验让权重持续进化,无需另行再训练。
AI 根据报道生成 · 2 小时前更新
最新进展10月6日 11:17
新报道细化机制:验证轨迹蒸馏进持久LoRA,无需外部答案或强教师。报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- AGI HuntASCENT:智能体部署中自蒸馏验证经验,权重持续进化无需再训练
ASCENT 提出 OaTTT:LLM 智能体在部署流式任务中用带验证结果的执行轨迹在线更新权重,且更新跨任务持久。方法以冻结的初始 LLM 副本接收验证轨迹作为特权信息,把 next-token 分布蒸馏进持久的 LoRA fast weights,无需外部参考答案或更强教师,并剔除无效动作轮次。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。