热点事件持续更新
医疗LLM评测活基准预印本发布
1 篇报道1 个报道来源11 小时前更新
先了解这件事
AI 综述
医疗大模型评测正面临「基准过期」困境:随模型持续迭代,静态评测基准很快失效。2026年10月6日报道,研究者为此发布新预印本,针对电子健康病历(EHR)的信息检索任务构建「活基准」(A Living Benchmark),用于持续评估不断演进的模型能否可靠检索临床医生所需的信息。该研究同时指出,「遗漏」(omission)是模型在EHR信息检索中的常见失败模式。报道还提到,另一团队在 NOHARM 预印本中观察到同样的现象,说明该失败模式并非孤例。目前该方法仍处于预印本阶段,后续进展有待跟进。
AI 根据报道生成 · 2 小时前更新
最新进展10月6日 00:30
研究者发布预印本,为EHR信息检索构建可持续评估模型的「活基准」。报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- AGI Hunt医疗 LLM 评测陷「基准过期」困境,新研究提出 EHR 信息检索「活基准」解法
研究者发布新预印本,为电子健康病历(EHR)信息检索构建「活基准」(A Living Benchmark),用于持续评估不断演进的模型能否可靠检索临床医生所需信息。团队发现「遗漏」(omission)是常见失败模式,另一团队在 NOHARM 预印本中也观察到同样现象。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。