跳到正文
原文
arXiv cs.AI· Subavarshana Arumugam, Mamta Nallaretnam, Kithuni Wickramasinghe, Chamath Gunapala, Pragatheeswaran Vipulanandan, Kamal Premaratne, Uthayasanker Thayasivam·· 1 天前AI 评分34

LLM 真的理解上下文吗?一个基于知识图谱的评估框架

Do LLMs Understand Context? A Knowledge Graph-Based Evaluation Framework

AI 导读

针对 LLM 的上下文理解,研究提出一套基于知识图谱(KG)的评估框架,核心指标 S3KG 将结构与语义信号融合为单一分数。该框架还提供 triplet 级诊断分析,用于识别并归类模型的推理错误。在 9 个 benchmark 上,S3KG 相比最强基线 F1 最高提升 +7.6 分,AUROC 最高达 0.973。

来源:arXiv cs.AI · arxiv.org