AGI Hunt· paraschopra·2026-09-29 12:05· 1 天前AI 评分34LLM 写原创笑话进步多大?paraschopra 发起人类众包评测AI 导读独立研究者 paraschopra 发起一项小型研究,以幽默为例检验前沿 LLM 在「不可验证领域」的进步,要求每个笑话必须包含两个随机抽取的词以强制新颖性。LLM-as-judge 结果显示模型随时间明显进步,现招募人类评分者(约 10 分钟)来校准判断,结果将优先邮件发给参与者。2 篇报道来源:AGI Hunt · agihunt.info#评测/基准查看事件全部后续