热点事件持续更新
语义缓存基准审计:23%错误命中实为同一prompt
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月2日,CacheVerifier 团队公布对语义缓存基准的审计结果。审计对象是 LMArena 上被标注为「错误命中」的近重复命中样本:在 3,117 个样本中,有 727 个(23.3%)在小写化、去标点处理后文本完全相同,即这些命中实际上来自同一个 prompt。团队另做盲测手工标注,结果显示 88% 的「错误」命中其实可复用。基于这些发现,0.97 阈值下的错误率由原先的 5.2% 修正到约 0.95%。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AGI HuntCacheVerifier 审计语义缓存基准:23% 的「错误命中」其实是同一 prompt
CacheVerifier 团队审计语义缓存基准发现,LMArena 上 3,117 个被标为「错误」的近重复命中中,727 个(23.3%)在小写化、去标点后文本完全相同;盲测手工标注显示 88% 的「错误」命中其实可复用,0.97 阈值的错误率从 5.2% 修正到约 0.95%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。