arXiv:cs.AI· Kaichao Jiang, Changtao Miao, Baiqi Wu, Zhiyuan Lu, Kang Yang, Peiwei Zhao, Junchi Chen, Yunfeng Diao, He Liu, Qi Chu, Tao Gong·· 3 小时前
Multi2AV-Safety:多模态到音视频生成的安全性基准测试
Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation
AI 导读
研究团队推出 Multi2AV-Safety,首个覆盖多模态到音视频生成的完整红队基准,包含 11,024 个攻击实例,覆盖全部 11 种 T/I/A/V 条件组合、4 类攻击意图和 5 类危害。
正文
Authors:Kaichao Jiang, Changtao Miao, Baiqi Wu, Zhiyuan Lu, Kang Yang, Peiwei Zhao, Junchi Chen, Yunfeng Diao, He Liu, Qi Chu, Tao Gong
Abstract:Recent audio-video generators increasingly support joint conditioning on text, images, audio, and video. These capabilities also enable attacks that exploit cross-modal interactions or obscure harmful intent to bypass safeguards and induce harmful audio-video outputs. However, existing generation-safety benchmarks have not kept pace with these advances, providing limited coverage of multimodal input combinations and obscured attack intents. To address these gaps, we introduce Multi2AV-Safety, the first full-coverage red-team benchmark for multimodal-to-audio-video generation, comprising 11,024 attack instances across all 11 non-singleton T/I/A/V conditioning configurations, 4 attack-intent categories, and 5 harm categories. Our evaluation of recent state-of-the-art models, including four multimodal-conditioned audio-video generators and eight safety guards, reveals substantial vulnerabilities in both generation and safeguarding, with multimodal compositional risk and obscured attack-intent risk emerging as two complementary challenges. Guided by these findings, we introduce PerceptGuard, an omni-modal guard integrating compositional-risk and attack-intent supervision through structured risk perception learning. By jointly training rationale generation and safety classification, it learns shared risk representations that enable a safety head to make efficient predictions at inference without rationale decoding, while retaining the ability to generate explanations on demand. Across 34 safety benchmarks, PerceptGuard combines SOTA multimodal safety detection with highly competitive unimodal performance, strengthening input-side safeguards against multimodal attacks on omni models. In particular, it improves safeguarding against the above risks, achieving an overall recall of 86.06\% on Multi2AV-Safety and outperforming GuardReasoner-Omni by 14.56\%.
| Subjects: | Artificial Intelligence (cs.AI) |
| Cite as: | arXiv:2608.26535 [cs.AI] |
| (or arXiv:2608.26535v2 [cs.AI] for this version) | |
| https://doi.org/10.48550/arXiv.2608.26535 arXiv-issued DOI via DataCite |
Submission history
From: Kaichao Jiang [view email]
[v1]
Thu, 27 Aug 2026 02:12:25 UTC (6,421 KB)
[v2]
Thu, 8 Oct 2026 10:54:46 UTC (4,157 KB)
来源:arXiv:cs.AI · arxiv.org