arXiv cs.AI· Ruoming Jin, Xinyu Li, Hao Zhou, Jianfeng Zhu, Ruixin Guo, Feodor Dragan, Lei Xu, Haixun Wang, Yang Zhou·· 4 小时前AI 评分33
GAP-DPO:面向个性化偏好优化的梯度对齐配对选择
Gradient-Aligned Pair Selection for Personalized Preference Optimization
AI 导读
GAP-DPO 将个性化偏好学习形式化为几何对齐优化问题,发现偏好边际与用户效用梯度方向对齐时,DPO 更新会从纠错信号转为类强化更新。该迭代算法据此做效用感知的偏好配对选择,并用 epoch-wise regeneration 控制分布偏移,在个性化文本生成基准上于风格保真度、偏好对齐和生成质量稳定优于标准 DPO 变体。
来源:arXiv cs.AI · arxiv.org