跳到正文
热点事件持续更新

医疗LLM评测活基准预印本发布

1 篇报道1 个报道来源11 小时前更新

先了解这件事

AI 综述

医疗大模型评测正面临「基准过期」困境:随模型持续迭代,静态评测基准很快失效。2026年10月6日报道,研究者为此发布新预印本,针对电子健康病历(EHR)的信息检索任务构建「活基准」(A Living Benchmark),用于持续评估不断演进的模型能否可靠检索临床医生所需的信息。该研究同时指出,「遗漏」(omission)是模型在EHR信息检索中的常见失败模式。报道还提到,另一团队在 NOHARM 预印本中观察到同样的现象,说明该失败模式并非孤例。目前该方法仍处于预印本阶段,后续进展有待跟进。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt
    医疗 LLM 评测陷「基准过期」困境,新研究提出 EHR 信息检索「活基准」解法

    研究者发布新预印本,为电子健康病历(EHR)信息检索构建「活基准」(A Living Benchmark),用于持续评估不断演进的模型能否可靠检索临床医生所需信息。团队发现「遗漏」(omission)是常见失败模式,另一团队在 NOHARM 预印本中也观察到同样现象。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。