跳到正文
原文
arXiv cs.CL· Shuqing Shi, Ziyan Wang, Milind Tambe, Yali Du·· 4 小时前AI 评分33

HARP:异构偏好下基于显式角色推断的大语言模型编排

Large Language Model Orchestration under Heterogeneous Preferences via Explicit Persona Inference

AI 导读

HARP 将偏好信念移出提示词,为每个智能体在有限候选偏好集上维护数值后验并按贝叶斯规则闭式更新,语言模型只提供动作与各候选似然,使估计与推理解耦。作者证明其在因子分解精确时达到与显式联合推断相同的 Õ(√K) 贝叶斯遗憾,HARP+ 还为可区分候选的动作加分,使最优动作无信息时推断仍继续。在三种测试环境下,HARP+ 是该理论界定类别中最强的非 oracle 方法。

来源:arXiv cs.CL · arxiv.org