跳到正文
原文
arXiv cs.AI· Sam Larson·· 4 小时前AI 评分35

语言模型对话幽默奖励的漏洞与对策

Comedic Fool's Gold: Reward Exploits and Countermeasures in Conversational Humor

AI 导读

对话幽默的自动化奖励存在漏洞:基于嵌入向量的“惊喜”奖励会把词序打乱的回复与机智回复同等接受。流畅度过滤器能识别打乱回复,但会误拒部分机智回复;受众模型的预测笑声易受双方笑声线索操纵,跨说话人归一化可挡住已覆盖攻击。三次强化学习实验中,最终一轮把综合评测分数提升 0.0903、零分会话减少 40%,但幽默专项提升仍低于预注册目标。

来源:arXiv cs.AI · arxiv.org