Holz 实验:LLM 互评谁玩得最开心
先了解这件事
2026 年 10 月 5 日,AGI Hunt 报道称 Midjourney 创始人 David Holz 做了一项实验:让多个 LLM 自由地“玩得开心”,记录过程后再让它们互相评价谁的玩法最有乐趣。结果显示,越新的模型反而越不尽兴;多数模型选择了文字游戏,而 Claude Opus 4.6 在互评环节反复胜出。10 月 6 日,AGI Hunt 后续报道补充了细节:多数模型玩的仍是文字游戏,Opus 4.6 则想象出“住在下落水滴里的、由矛盾构成的短暂世界”,Mistral 的 eliebakouch 回复称这超酷。同日稍晚的第三篇报道再次确认上述结果,并补充两点新信息:eliebakouch 指出评分与报告长度高度相关,Holz 回应称短篇也可能真的写得差。三篇报道均未披露参与实验的具体模型名单、评分方式,以及“不尽兴”的判定标准,也未给出完整数据。目前该实验仅有 AGI Hunt 的公开报道,尚无其他来源的补充。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- AGI HuntDavid Holz 让 LLM 玩乐互评:Opus 4.6 反复胜出,新模型越玩越不开心
David Holz 发起实验,让各家 LLM 尽情玩乐并写下经过、再互评谁玩得最开心,结果越新的模型似乎越不会玩,Opus 4.6 反复胜出。Opus 4.6 靠想象「住在正在下落的水滴里的矛盾生物」这类自相矛盾的微型世界夺冠。后续讨论中 eliebakouch 指出评分与报告长度高度相关,Holz 回应称短篇也可能真的写得差。
- AGI Hunt让 LLM 比"谁玩得最开心":新模型反而更不好玩,Opus 4.6 夺冠
David Holz 让多个 LLM"找乐子"并互相评分谁最开心,结果显示越新的模型似乎越不有趣,Opus 4.6 反复胜出。多数模型玩的是文字游戏,Opus 4.6 则想象出"住在下落水滴里的、由矛盾构成的短暂世界"。Mistral 的 eliebakouch 回复称这超酷。
- AGI HuntMidjourney 创始人 David Holz 实验:让 LLM 自评玩耍乐趣,新版模型反而不尽兴
Midjourney 创始人 David Holz 让多个 LLM 自由“玩得开心”,记录过程后再互评谁的玩法最有乐趣,结果越新的模型反而越不尽兴。不少模型选择了文字游戏,Claude Opus 4.6 在互评中反复胜出。
本事件热度走势
当前热度 9·可比范围峰值 10(10月6日 18:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。