跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Thomas Reiter, Christoph Kern, Fedor Miasnikov, Sofiia Nikolenko, Rob Chew, Stephanie Eckman, Frauke Kreuter·· 1 天前AI 评分44

LLM 标注可靠但设计敏感:任务设计与模型选择带来的工具不确定性

Reliable but Design-Sensitive: Instrument Uncertainty in LLM Annotation

AI 导读

研究测试 7 个 LLM、12 种任务设计、3 次独立运行,对 3000 条推文进行冒犯性语言与仇恨言论标注,同一模型与设计重复运行的中位 Fleiss' κ 达 0.91,更换任务设计后中位 Cohen's κ 降至 0.76。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org