跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Chenguang Wang, Ming Li, Chengrui Fan, Jianpeng Chen, Han Chen, Tianyi Zhou, Dawei Zhou·· 3 小时前AI 评分37

可信 AI 审稿人缺失的一环:从修辞鲁棒性基准测试到 SciCore Review

A Missing Piece for Trustworthy AI Reviewers: From Benchmarking Rhetorical Robustness to SciCore Review

AI 导读

研究提出"修辞鲁棒性"概念,要求 AI 审稿人对内容相同但措辞不同的稿件给出一致判断,同时保持对不同论文的区分能力。团队构建 RobustReview 基准,含 1,260 个稿件版本,评测 30 种审稿配置,发现存在"虚假鲁棒性"——改写敏感度低与跨论文评分崩塌同时出现,且人类对齐与修辞鲁棒性的审稿人排名并不一致。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org