跳到正文
原文
AGI Hunt· Haodong Lu·· 8 小时前AI 评分42

ASCENT:智能体部署中自蒸馏验证经验,权重持续进化无需再训练

ASCENT:智能体部署中自蒸馏验证经验,权重持续进化无需再训练

AI 导读

ASCENT 提出 OaTTT:LLM 智能体在部署流式任务中用带验证结果的执行轨迹在线更新权重,且更新跨任务持久。方法以冻结的初始 LLM 副本接收验证轨迹作为特权信息,把 next-token 分布蒸馏进持久的 LoRA fast weights,无需外部参考答案或更强教师,并剔除无效动作轮次。

来源:AGI Hunt · agihunt.info