arXiv cs.CL· Chenxu Wang, Chaozhuo Li, Xinze Shi, Songyang Liu, Kyrie You Wu, Ziluowen Luo, Shun Zhang, Chenxi Li, Litian Zhang·· 4 小时前AI 评分35
当更新不再等于学习:通过可学习信息增益重新思考 LLM 自进化
When Updating Stops Being Learning: Rethinking LLM Self-Evolution via learnable information gain
AI 导读
针对 LLM 自进化中性能先提升、后停滞再下降的"自进化退化",该工作提出以可学习信息增益为核心的整体框架,并给出训练调控方法 ATRI。该增益等于两轮数据分布的 KL 散度加熵变化,实际通过用小型语言模型拟合上一轮数据、以负对数似然给新数据打分来估计。ATRI 在轮内对样本重加权,并在跨轮信息增益持续偏低时终止训练,在常用数据集上的实验显示其效果更优。
来源:arXiv cs.CL · arxiv.org