跳到正文
原文
AGI Hunt· Reasonable_Royal_621·· 2 小时前AI 评分47

CacheVerifier 审计语义缓存基准:23% 的「错误命中」其实是同一 prompt

审计发现语义缓存基准 23% 的「错误命中」其实是同一 prompt

AI 导读

CacheVerifier 团队审计语义缓存基准发现,LMArena 上 3,117 个被标为「错误」的近重复命中中,727 个(23.3%)在小写化、去标点后文本完全相同;盲测手工标注显示 88% 的「错误」命中其实可复用,0.97 阈值的错误率从 5.2% 修正到约 0.95%。

来源:AGI Hunt · agihunt.info