跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Ian Arawjo·· 1 天前AI 评分46

如何对 LLM 评审做统计并信任结果:evalstats 面向小样本 AI 评估的校准推断

How to Run Statistics over LLM Judges and Trust the Results: Calibrated Inference for Small-Sample AI Evaluation with evalstats

AI 导读

研究者提出 evalstats,一个开源 Python 包,用于对混合人类-AI 评审设计做校准统计分析,可自动选择合适方法。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org