arXiv:cs.LG(机器学习,全量分类)· Jacob Cole·· 1 天前AI 评分38
二值化如何压平评分空间:LLM 评审奖励的盲区与三档评分建议
Binarization Flattens the Score Space
AI 导读
将 LLM 评审的通过/不通过({0, 1})二值化会压平评分空间,使按比例拉伸分数但不变更判定结果的操作完全不可见。在一个七准则评审对 MATH 和 SciBench 输出的测试中,14 个构造的准则级拉伸在二值化后均不可见,改用三档评分后则全部可见;在 n=1,024 时,同时给定两种总体分布的检验在 1.5× 压力下功效至少 96.5%。
来源:arXiv:cs.LG(机器学习,全量分类) · arxiv.org