跳到正文
原文
AGI Hunt· alexisjross·· 10 小时前AI 评分35

用户模型评测为何难做:斯坦福研究者转向多用户图灵测试

用户模型评测为何难做:斯坦福研究者转向多用户图灵测试

AI 导读

斯坦福研究者 alexisjross 团队转向多用户图灵测试(MTT)评测用户模型,因为现有评测都要求预先定义评估维度。该方案用 LM judge 判别,不预设好用户模型的先验,而让 judge 基于真实用户与模拟用户的上下文示例自行推理最相关的行为特征。团队引用 ELIZA 案例称,人类本身就不擅长判断模拟用户的模型是否像真人。

来源:AGI Hunt · agihunt.info