跳到正文
原文
AGI Hunt· paraschopra·· 1 天前AI 评分34

LLM 写原创笑话进步多大?paraschopra 发起人类众包评测

AI 导读

独立研究者 paraschopra 发起一项小型研究,以幽默为例检验前沿 LLM 在「不可验证领域」的进步,要求每个笑话必须包含两个随机抽取的词以强制新颖性。LLM-as-judge 结果显示模型随时间明显进步,现招募人类评分者(约 10 分钟)来校准判断,结果将优先邮件发给参与者。

来源:AGI Hunt · agihunt.info