热点事件持续更新
CineSubBench:电影字幕评测 LLM 长上下文
2 篇报道2 个报道来源3 小时前更新
先了解这件事
AI 综述
2026 年 9 月 30 日,AGI Hunt 与 arXiv cs.CL 先后报道新基准 CineSubBench。该基准使用 1,012 部电影、6 种语言、6,072 条字幕轨、813 万条带时间戳字幕,用来评估大模型的长上下文叙事与文化理解能力。它设 7 项任务,覆盖叙事重建与抽象、类型预测、年龄适宜性以及 10 个国家的分级体系。对九个 LLM 的评测显示:模型在情节梗概还原上的表现比完整事件概要更可靠;跨语言一致性因模型与语言不同而差异显著;模型对强脏话的识别能力远高于对轻度粗俗语的识别。早先 AGI Hunt 的报道未提及字幕轨数量,后续 arXiv 报道补充为 6,072 条;两篇报道在电影数、语言数、字幕条目数和评测结论上一致。
AI 根据报道生成 · 2 小时前更新
最新进展9月30日 12:00
arXiv cs.CL 论文补充细节:基准含 6,072 条字幕轨。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv cs.CLCineSubBench:用多语言电影字幕评测 LLM 的长篇叙事与文化理解
新基准 CineSubBench 用多语言电影字幕评测 LLM 的长篇叙事与文化理解,覆盖 1,012 部电影、六种语言、6,072 条字幕轨和 8.13M 条带时间戳字幕条目。
- AGI HuntCineSubBench:用 1012 部电影字幕考 LLM 长叙事与文化理解
新基准 CineSubBench 用 1012 部电影、6 种语言的 813 万条带时间戳字幕,评估 LLM 的长上下文叙事与文化理解。它设 7 项任务,覆盖叙事重建与抽象、类型预测、年龄适宜性及 10 国分级体系。对九个 LLM 的评测显示,情节梗概还原比完整事件概要更可靠,跨语言一致性因模型与语言差异显著,强脏话远比轻度粗俗语更易识别。
本事件热度走势
当前热度 18·可比范围峰值 18(9月30日 14:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。