arXiv cs.CL· Thomas Reiter, Christoph Kern, Fedor Miasnikov, Sofiia Nikolenko, Rob Chew, Stephanie Eckman, Frauke Kreuter·· 5 小时前AI 评分50
LLM 标注可靠但设计敏感:研究提出并量化工具不确定性
Reliable but Design-Sensitive: Instrument Uncertainty in LLM Annotation
AI 导读
研究用 7 个 LLM、12 种任务设计和 3000 条推文测试标注稳定性,同一模型与任务设计重复运行的一致性较高(Fleiss' κ 中位数 0.91),更换任务设计后下降(Cohen's κ 中位数 0.76)。
来源:arXiv cs.CL · arxiv.org