跳到正文
热点事件持续更新

CineSubBench:电影字幕评测 LLM 长上下文

2 篇报道2 个报道来源3 小时前更新

先了解这件事

AI 综述

2026 年 9 月 30 日,AGI Hunt 与 arXiv cs.CL 先后报道新基准 CineSubBench。该基准使用 1,012 部电影、6 种语言、6,072 条字幕轨、813 万条带时间戳字幕,用来评估大模型的长上下文叙事与文化理解能力。它设 7 项任务,覆盖叙事重建与抽象、类型预测、年龄适宜性以及 10 个国家的分级体系。对九个 LLM 的评测显示:模型在情节梗概还原上的表现比完整事件概要更可靠;跨语言一致性因模型与语言不同而差异显著;模型对强脏话的识别能力远高于对轻度粗俗语的识别。早先 AGI Hunt 的报道未提及字幕轨数量,后续 arXiv 报道补充为 6,072 条;两篇报道在电影数、语言数、字幕条目数和评测结论上一致。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv cs.CL
    CineSubBench:用多语言电影字幕评测 LLM 的长篇叙事与文化理解

    新基准 CineSubBench 用多语言电影字幕评测 LLM 的长篇叙事与文化理解,覆盖 1,012 部电影、六种语言、6,072 条字幕轨和 8.13M 条带时间戳字幕条目。

  2. AGI Hunt
    CineSubBench:用 1012 部电影字幕考 LLM 长叙事与文化理解

    新基准 CineSubBench 用 1012 部电影、6 种语言的 813 万条带时间戳字幕,评估 LLM 的长上下文叙事与文化理解。它设 7 项任务,覆盖叙事重建与抽象、类型预测、年龄适宜性及 10 国分级体系。对九个 LLM 的评测显示,情节梗概还原比完整事件概要更可靠,跨语言一致性因模型与语言差异显著,强脏话远比轻度粗俗语更易识别。

本事件热度走势

当前热度 18·可比范围峰值 18(9月30日 14:00)·近 24 小时可比范围变化 –

051015209月30日10:009月30日12:009月30日13:009月30日15:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。