跳到正文
热点事件持续更新

PEV:随机嵌入扰动越狱开源权重LLM

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

UC Santa Cruz 研究者 Abhinav Sudhakar Dubey 等人在 arXiv 论文(arXiv:2610.07125)中提出一种名为 Perturbed Embedding Vector(PEV)的越狱攻击:只需在提示词的嵌入向量表示中反复采样加入独立高斯噪声,无需梯度计算、逐提示词优化,也不修改模型内部权重。 作者称,在 JailbreakBench 基准测试的全部提示词上,PEV 对六款开源权重 LLM 都能生成不安全回答;首次攻击成功的平均算力成本比以往攻击方法低最多一个数量级,每个受测模型上针对新提示词的首个成功越狱通常在一分钟内出现。上述效果均为论文作者在论文中的表述。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    UCSC 论文提出 PEV 攻击:随机嵌入扰动可越狱六款开源权重 LLM

    UC Santa Cruz 研究者在 arXiv 论文(arXiv:2610.07125)中提出 Perturbed Embedding Vector(PEV)越狱攻击,只需向提示词的嵌入向量表示中反复采样加入独立高斯噪声,无需梯度计算、逐提示词优化或修改模型内部权重。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。