MoE视觉语言模型路由logit安全检测器
热点事件持续更新
MoE视觉语言模型路由logit安全检测器
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
研究者 Ziyuan Yang 等人提出一种轻量级 router-logit 安全检测器,在 prompt prefill 阶段读取 MoE 视觉语言模型的 routing 信号,在生成前识别不安全请求,且不修改模型参数与专家路由。 据该研究,在 Qwen3-VL 和 Kimi-VL 上,该检测器大幅降低 HoliSafe 基准的安全错误,并泛化到 MISHard 和 MM-SafetyBench 等分布外安全基准。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
不操控只读取:用 Router Logits 为 MoE 视觉语言模型做多模态安全检测报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.CL不操控只读取:用 Router Logits 为 MoE 视觉语言模型做多模态安全检测
研究者提出一种轻量级 router-logit 安全检测器,在 prompt prefill 阶段读取 MoE 视觉语言模型的 routing 信号,在不修改模型参数与专家路由的前提下,于生成前识别不安全请求。在 Qwen3-VL 和 Kimi-VL 上,该检测器大幅降低 HoliSafe 基准的安全错误,并泛化到 MISHard 和 MM-SafetyBench 等分布外安全基准。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。