跳到正文
arXiv:cs.AI· Jiawen Wang, Xiaoxue Gao, Zi Haur Pang, Nancy F. Chen·· 4 小时前AI 评分40

EXAM²:面向多语言与多模态音频理解的基准测试

EXAM2: Extending Audio Understanding in Multilingual and Multimodal Analysis

AI 导读

研究者推出 EXAM² 基准,覆盖六种语言及语音、声音、音乐、混合音频与图像等多种模态,包含 5,667 道多选题、22,614 个图像实例和 135,684 条多语言翻译。

正文

View PDF HTML (experimental)

Abstract:Recent large audio language models (LALMs) have achieved impressive progress in audio understanding. However, existing evaluations remain largely constrained to English and narrow audio domains. Prior benchmarks typically focus on a single audio modality, i.e., speech, sound, or music, limiting the systematic investigation into how these models generalize across diverse visual scenarios. In this paper, we introduce EXAM$^2$, a benchmark for multilingual and multimodal audio understanding spanning six languages and multiple modalities, including speech, sound, music, mixed-audio settings, and visual images. By incorporating visual information alongside heterogeneous audio inputs, EXAM$^2$ enables more realistic evaluation of scene-aware audio reasoning and cross-modal comprehension. EXAM$^2$ comprises $5,667$ multiple-choice questions, $22,614$ image instances, and $135,684$ multilingual translations. We evaluate state-of-the-art open-source and proprietary LALMs as well as multimodal LLMs, revealing substantial performance gaps in multilingual and cross-modal understanding. Furthermore, we propose Gemma3n-EXAM$^2$, a lightweight fusion-model fine-tuned on EXAM$^2$-train, achieves up to $15.8\%$ improvement in multilingual settings and $16.5\%$ gains in multimodal evaluation over a strong baseline. Empirical results establish EXAM$^2$ as a challenging benchmark and pioneer future multilingual and multimodal audio intelligence research.
Comments: 9 pages, 2 figures
Subjects: Sound (cs.SD); Artificial Intelligence (cs.AI)
Cite as: arXiv:2608.23758 [cs.SD]
  (or arXiv:2608.23758v3 [cs.SD] for this version)
  https://doi.org/10.48550/arXiv.2608.23758

arXiv-issued DOI via DataCite

Submission history

From: Jiawen Wang [view email]
[v1] Mon, 24 Aug 2026 18:52:22 UTC (29,496 KB)
[v2] Thu, 27 Aug 2026 09:29:08 UTC (29,496 KB)
[v3] Fri, 2 Oct 2026 15:52:57 UTC (29,497 KB)

来源:arXiv:cs.AI · arxiv.org