arXiv cs.CL· Haixu Ma, Saad Lahrichi, Weiwei Li, Kevin Han, Weiqiang Wu, Peggy Yang, Dongzhuo Li, Ruiyi Li, Serena Li, Gedi Zhou, Mingze Gao, Abhishek Kumar, Xiangjun Fan, Lizhu Zhang·· 2 天前AI 评分35
对抗式黑盒在线策略蒸馏的持续负样本方法
Persistent Negatives for Adversarial Black-Box On-Policy Distillation
AI 导读
持续负样本对抗蒸馏用历史提示词匹配的师生对比样本替换部分判别器批次,缓解黑盒在线策略蒸馏中负样本分布随策略更新漂移的移动目标问题。在匹配判别器算力下,该方法跨两个学生模型家族、三个评判模型与四个评判对话基准稳定优于现有方法。其贝叶斯最优奖励为教师到负样本的对数密度比,持久负样本可锚定判别器并降低奖励估计 MSE。
来源:arXiv cs.CL · arxiv.org