AGI Hunt· eliebakouch·· 4 小时前AI 评分41
David Holz 让 LLM 玩乐互评:Opus 4.6 反复胜出,新模型越玩越不开心
让 LLM 玩乐并互评:新模型玩得越来越不开心
AI 导读
David Holz 发起实验,让各家 LLM 尽情玩乐并写下经过、再互评谁玩得最开心,结果越新的模型似乎越不会玩,Opus 4.6 反复胜出。Opus 4.6 靠想象「住在正在下落的水滴里的矛盾生物」这类自相矛盾的微型世界夺冠。后续讨论中 eliebakouch 指出评分与报告长度高度相关,Holz 回应称短篇也可能真的写得差。
来源:AGI Hunt · agihunt.info