arXiv cs.AI· Fan Huang, Minsuk Kim, C. Tyler Diggans, Filippo Radicchi·· 4 小时前AI 评分37
评估 LLM 生成的偏好分布:模型选择比提示词影响更大
Evaluating LLM-Generated Preference Distributions
AI 导读
一项研究系统评估了 LLM 生成的偏好分布,覆盖九个开源权重模型和航空出行、餐厅、消费品三个选择域。所有模型都表现出自洽性,最可能结果在重复采样下迅速稳定,但模型族与规模之间存在显著不一致,连最可能结果也鲜有共识。偏好分布更多取决于模型选择而非提示词措辞,挑战了能力足够强的 LLM 可替代问卷受访者的假设。
来源:arXiv cs.AI · arxiv.org