跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Xinkai Chen·· 3 小时前AI 评分37

结构化标准提取 vs. 思维链:评估 LLM 对抑郁严重程度的标准提取

Structure vs. Chain-of-Thought: Evaluating LLM Criteria Extraction for Depression Severity

AI 导读

研究对比了 LLM 直接评分与临床标准提取两种抑郁严重程度评估方式,在 Reddit 语料上用 3 个 LLM(9B 至前沿规模)和 PHQ-9、BDI-II 两份问卷以二次加权 kappa 衡量一致性。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org