跳到正文
热点事件持续更新

SafeBridge:LoopLM跨循环深度安全对齐方法

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Yi Wang等作者提出并研究面向循环语言模型(LoopLM)的跨循环深度安全对齐方法SafeBridge,结合对共享循环层的轻量级深度专属控制、选择性状态桥接和跨循环深度的联合安全监督。 研究指出,LoopLM在越狱攻击下攻击成功率会随推理深度加深而上升,同一查询在不同循环深度可产生不同安全行为,针对某一深度构造的攻击还能迁移到其他深度,SFT与偏好对齐均无法消除这些安全差距。 作者称,代码和模型检查点将在论文被接收后发布。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.LG
    循环语言模型的安全性不能只看单一循环深度:SafeBridge 对齐跨循环深度安全

    研究发现循环语言模型(LoopLM)在越狱攻击下攻击成功率会随推理深度加深而上升,同一查询在不同循环深度可产生不同安全行为,针对某一深度构造的攻击还能迁移到其他深度,SFT 与偏好对齐均无法消除这些安全差距。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。