arXiv:cs.CL(计算语言学,全量分类)· Ian Arawjo·· 1 天前AI 评分46
如何对 LLM 评审做统计并信任结果:evalstats 面向小样本 AI 评估的校准推断
How to Run Statistics over LLM Judges and Trust the Results: Calibrated Inference for Small-Sample AI Evaluation with evalstats
AI 导读
研究者提出 evalstats,一个开源 Python 包,用于对混合人类-AI 评审设计做校准统计分析,可自动选择合适方法。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org