跳到正文
原文
arXiv:cs.LG(机器学习,全量分类)· Joseph H. Rudoler, Kevin Tan, Benedict Tessler, Timothy Kong, Enric Boix Adser\`a·· 1 天前AI 评分39

用协同训练的监控器改进可扩展监督

Improving scalable oversight with co-trained monitors

AI 导读

研究提出让监控器与工作模型协同训练,以避免工作模型针对固定监控器学会规避。监督设定下证明:当可能监控函数类的 Littlestone 维度有限时,监控可以做到误差与查询率趋近于零;自监督设定下提出基于测试时蒸馏的协同训练流程,监控器用额外测试时算力生成训练标签,再训练其标准算力策略,并对多数投票标签给出有限样本锐化保证。

来源:arXiv:cs.LG(机器学习,全量分类) · arxiv.org