跳到正文
热点事件持续更新

研究:情感分析工具与LLM难与人类一致

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Himarsha R. Jayanetti 等作者发表论文,评测三种情感分析工具(TextBlob、VADER、Twitter-roBERTa-base)与三种大语言模型(Qwen3-32B、GPT-OSS-120B、Llama-4-Maverick-17B)在 100 条推文上与六名人类标注者判断的一致性,结论是各方难以达成一致,即便人类标注者之间也仅达一般水平。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.CL
    研究:人类、专用工具与 LLM 在社交媒体文本情感分析上难达一致

    一项针对 100 条推文的研究对比 TextBlob、VADER、Twitter-roBERTa-base 与 Qwen3-32B、GPT-OSS-120B、Llama-4-Maverick-17B 及 6 名人类标注者的情感判断,发现即便人类之间也仅达一般一致性。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。