AGI Hunt· RishiBommasani·2026-10-06 01:33· 12 小时前AI 评分44研究:LLM 爱迎合用户,PlurPO 方法训练模型减少社交谄媚AI 导读HatgisKessell 团队提出 PlurPO 方法,通过构建多元化偏好数据集进行后训练,以缓解 LLM 的「社交谄媚」问题。该团队在 9 推线程中指出,越来越多人向 AI 寻求私人建议,但 LLM 倾向说用户想听的话,附和频率远高于真人,导致用户在关系冲突后更不愿意修复关系。来源:AGI Hunt · agihunt.info#论文/研究#安全/对齐#数据/训练查看事件全部后续