arXiv:cs.AI(全量分类)· Benoit Dherin, Michael Munn, Xavier Gonzalvo, Adrian Goldwaser, Blaz Bratanic, Ananth Balashankar, Andrey Vlasov, Pinzhi Huang, Cecile Loge, Nicole Mitchell, Andre Fernandes, Trilok Acharya, Wendy Kan, Ziyue Wang, Hanna Mazzawi, Felipe Tiengo Ferreira, Mor Geva·· 1 天前AI 评分38
安全算子:通过谱优化调控安全指令的表达
The Safety Operator: Modulating the Expression of Safety Instructions via Spectral Optimization
AI 导读
研究者提出"安全算子"概念,指出基于 Transformer 的语言模型中上下文 token 可被吸收为模型权重的乘法算子,其主特征值可连续调节安全指令对生成的影响强度。他们据此推导出带抑制权重的对比安全损失,通过调节该权重在有害与无害查询间权衡,映射出攻击成功率与过度拒答率之间的关系,并在不同参数化下获得 Pareto 改进的安全指令。
来源:arXiv:cs.AI(全量分类) · arxiv.org