跳到正文
热点事件持续更新

Paras Chopra 发布 LLM 笑话盲测实验

3 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 6 日,Paras Chopra 在其 Substack 发布 LLM 幽默实验的方法与结果。实验邀请 62 名受访者,对来自六个模型的 48 个笑话进行盲评,结果显示 Astra 以超过 50% 的「会心一笑/大笑」率排名第一。该实验要检验前沿模型在幽默这一不可验证、依赖「品味」的领域是否持续进步——报道称 GPT-3 时代的模型只会复述网上老梗,而两年的对比显示幽默感持续提升。实验背后的核心问题是:数学、代码等可验证领域上的能力进步,能否迁移到这类软性能力上。10 月 6 日 20:37,AGI Hunt 发布三篇后续报道,均复述了同一组数字与结论:62 人、48 个笑话、六个模型、Astra 夺冠及其 50%+ 的「会心一笑/大笑」率,未给出新数据,与早先报道之间未出现矛盾。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt
    LLM 笑话实验全纪录:两年对比显示幽默感持续进步

    Paras Chopra 在 Substack 发布 LLM 幽默实验方法与结果:62 名受访者盲评六个模型的 48 个笑话,Astra 以 50%+ 的「会心一笑/大笑」率夺冠。实验检验前沿模型在「幽默」这一不可验证领域是否持续进步——GPT-3 时代模型只会复述网上老梗。核心问题是数学、代码等可验证域的能力进步能否迁移到依赖「品味」的软性能力。

  2. AGI Hunt
    62人盲测48个LLM笑话 大模型幽默感持续进步

    Paras Chopra 发布实验,62 名受访者对来自六个模型的 48 个笑话盲测评分,结果显示前沿大模型的幽默感确实在进步,与 GPT-3 时代只会复述网上老梗形成对比。完整方法与结果已在 Substack 公开,两年对比进一步表明大模型在「幽默」这类不可验证领域的能力持续提升。

  3. AGI Hunt
    62 人盲测 48 个 LLM 笑话:幽默感真的在变强

    Paras Chopra 的盲测实验显示,62 名受访者对来自六个模型的 48 个笑话评分,Astra 拿下第一,获得超过 50% 的「会心一笑/大笑」反应。结果说明前沿大模型的幽默感确实在进步,作者借此检验数学、代码等可验证领域的能力进步能否迁移到幽默这类难以验证、依赖品味的软性能力,完整方法与结果发布在其 Substack 文章中。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。