热点事件持续更新
研究量化LLM标注的工具不确定性
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
2026年9月30日,arXiv cs.CL 刊出一项研究,用7个大型语言模型、12种任务设计和3000条推文测试LLM标注的稳定性,并提出并量化“工具不确定性”。结果显示:同一模型、同一任务设计重复运行时一致性较高,Fleiss' κ 中位数为0.91;更换任务设计后一致性下降,Cohen's κ 中位数降至0.76。研究据此认为LLM标注整体可靠,但对任务设计敏感,标注结果中的部分不确定性来自工具(模型与设计组合)而非标注对象本身。报道未给出更早版本的数据,因此不存在与先前数字互相矛盾的情况;目前公开的进展即上述两项一致性指标。
AI 根据报道生成 · 3 小时前更新
最新进展9月30日 12:00
研究用7个LLM、12种设计测3000条推文,标注一致性在更换任务设计后下降。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv cs.CLLLM 标注可靠但设计敏感:研究提出并量化工具不确定性
研究用 7 个 LLM、12 种任务设计和 3000 条推文测试标注稳定性,同一模型与任务设计重复运行的一致性较高(Fleiss' κ 中位数 0.91),更换任务设计后下降(Cohen's κ 中位数 0.76)。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。