SBW:抗改写防伪造的智能体行为水印
热点事件持续更新
SBW:抗改写防伪造的智能体行为水印
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
Suxin Ji等研究者提出语义行为水印SBW,用于大语言模型智能体的来源追溯:在历史条件下的语义动作簇上嵌入水印,并以密钥化抗碰撞分桶替代公开簇分桶,称其新桶分配在随机预言机模型下可证不可预测。 在ToolBench和ALFWorld上,该方法改写下的检测率最高达0.97,并将自适应伪造从100%降至假阳性下限;代价是每步水印容量约减半。当攻击者复制受害者自身步骤时,乱序拼接被消除(Qwen2.5-3B上为0.000),但链式重放仍在五个模型上保持0.76-0.98,作者将其列为待解问题。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
面向 LLM 智能体的语义行为水印:抗改写且防伪造的来源追溯报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.AI面向 LLM 智能体的语义行为水印:抗改写且防伪造的来源追溯
研究者提出语义行为水印 SBW,在历史条件下的语义动作簇上嵌入水印,并用密钥化抗碰撞分桶替代公开簇分桶,在随机预言机模型下分桶分配不可预测。在 ToolBench 和 ALFWorld 上,该方法在改写下的检测率最高达 0.97,并将自适应伪造从 100% 降至假阳性下限。其局限是链式重放仍保持 0.76-0.98,且抗改写的代价是每步水印容量约减半。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。