跳到正文
原文
arXiv:cs.AI(全量分类)· Adam Elimadi·· 1 天前AI 评分39

表征简洁性与电路规模在阈值依赖下解离:一项对抗训练的受控检验

Representational Simplicity and Circuit Size Dissociate in a Threshold-Dependent Way: A Controlled Test via Adversarial Training

AI 导读

研究以对抗训练为受控工具,检验表征与归因的简洁性是否能预测更小的因果电路。从同一 GPT-2 Small 检查点出发做匹配的标准与对抗持续训练,对抗模型在 SAE 可分解性和任务归因中启用的 SAE 特征数上更优,但电路规模呈阈值依赖:在 IOI 任务上,85% 忠实度以下标准模型领先或持平,90% 与 95% 高忠实度下对抗模型所需边数显著更少。

来源:arXiv:cs.AI(全量分类) · arxiv.org