跳到正文
原文
arXiv:cs.AI(全量分类)· Ziyang Xu, Haitian Zhong, Hao Zhou, Hao Qin, Chenhan Jin, Te Qi, Shengze Xu, Tieyong Zeng·· 1 天前AI 评分46

更多程序还是更多重复执行?区分 LLM Harness 中的覆盖度与专业化

More Programs or More Rolls? Separating Coverage from Specialization in LLM Harnesses

AI 导读

一项受控评估在 386 个 MATH-500 任务上比较了 8 个生成的 LLM harness 与 9 个字节完全相同的基线副本,发现相同程序本身就能带来 2.16 个百分点的重复平均 oracle 余量。

来源:arXiv:cs.AI(全量分类) · arxiv.org