arXiv:cs.CL(计算语言学,全量分类)· Xinkai Chen·· 3 小时前AI 评分37
结构化标准提取 vs. 思维链:评估 LLM 对抑郁严重程度的标准提取
Structure vs. Chain-of-Thought: Evaluating LLM Criteria Extraction for Depression Severity
AI 导读
研究对比了 LLM 直接评分与临床标准提取两种抑郁严重程度评估方式,在 Reddit 语料上用 3 个 LLM(9B 至前沿规模)和 PHQ-9、BDI-II 两份问卷以二次加权 kappa 衡量一致性。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org