arXiv:cs.CL(计算语言学,全量分类)· Haohan Yuan, Simin Chen, Xi Niu, Hanqing Guo, Depeng Xu, Haopeng Zhang·· 3 小时前AI 评分49
用定向改写伪造 LLM 作者指纹:ForgePrint 框架实现 70.2% 目标归属成功率
Forging LLM Authorship Fingerprints with Targeted Rewriting
AI 导读
研究者提出 ForgePrint,一种"先搜索后蒸馏"框架,通过定向改写让归属分类器把某模型的输出误判为指定目标模型。在 CNN/DM 上,蒸馏出的 4B Student 模型对未参与攻击的留出分类器达到 70.2% 目标成功率,超过其 Teacher(54.1%)和六个已发表改写基线中最强者(39.3%);将开源模型摘要迁移至选定商业模型时成功率为 68.3%。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org