跳到正文
原文
arXiv cs.CL· Jingxuan Wu, Yuzhe Yang, Yiqiao Huang, Chengzhi Liu, Qingni Wang, Chengxuan Qian, Shutong Wu, Jiawei Zhang, Xin Eric Wang·· 4 小时前AI 评分35

MemFold:通过 On-Policy 优化学习面向长上下文个性化的紧凑软记忆

MemFold: Learning Compact Soft Memory for Long-Context Personalization via On-Policy Optimization

AI 导读

MemFold 将查询条件下的文本记忆压缩为 K 个连续向量作为 reader 的记忆接口,用任务结果的组相对奖励加冻结教师的 on-policy 蒸馏信号在 reader 自身 rollout 上训练,推理时移除教师。

来源:arXiv cs.CL · arxiv.org