跳到正文
原文
AGI Hunt· deliprao·· 6 小时前AI 评分52

UPenn 研究:前沿 LLM 验证科学声明走捷径,非显著约束错误全部漏过

UPenn研究:前沿LLM验证科学声明走捷径致约束错误全漏

AI 导读

UPenn NLP 的 Delip Rao 团队将在 COLM26 报告一项研究,发现前沿 LLM 在科学和医学声明的验证基准上得分很高,但多数并非逐条核对证据,而是只做显著约束检查。只要最显眼的约束成立,模型就判定声明为真,非显著约束的错误全部漏过。医学试验实测中,一份注明仅对日本女性开放的证据被翻转为不限族裔后,多数前沿模型仍错误通过验证。

来源:AGI Hunt · agihunt.info