跳到正文
arXiv:cs.CL· Riju Marwah, Ritvik Garimella, Khusham Bansal, Atishay Jain, Amit Sheth·· 5 小时前AI 评分40

多语言提示词污染下的输出语言混淆:MDI 评估协议

Output Language Confusion under Multilingual Prompt Contamination

AI 导读

研究者提出 Multilingual Distractor Interference(MDI)评估协议,在 TruthfulQA 和 TriviaQA 上以八种干扰条件对五个指令微调 LLM 完成 40,000 次评测。

正文

View PDF HTML (experimental)

Abstract:Standard factual benchmarks assume clean monolingual prompts and exact-match scoring, two assumptions that break simultaneously in real-world multilingual deployment, from retrieval-augmented generation pipelines returning mixed-language passages to users pasting multilingual web content. We introduce Multilingual Distractor Interference (MDI), a lightweight and fully replicable evaluation protocol requiring no new data or annotation, in which factual questions are preceded by a semantically irrelevant foreign-language sentence, and evaluate five instruction-tuned LLMs across TruthfulQA and TriviaQA under eight distractor conditions (40,000 evaluations). Our central finding is a metric confound: for Llama-3.1-8B under a Hindi distractor, 58% of responses switch to Devanagari script, yielding a raw hallucination proxy of 0.710, but manual review reveals that 120 of 148 script-switched responses that were correct under clean conditions remain semantically correct despite being written in the wrong script, reducing the adjusted semantic hallucination rate to 0.470. All other models respond through abstention escalation with no hallucination increase. A paragraph-length English distractor triggers near-universal abstention (0.806-0.998) across all models, consistent with reading-comprehension confusion, a failure mode with direct consequences for multilingual RAG pipelines. TruthfulQA multiple-choice accuracy is unaffected under all single-sentence conditions. These results show that exact-match hallucination rates in mixed-language settings should be decomposed into script-switching and semantic error components before drawing conclusions about model reliability.
Comments: Accepted at NeurIPS 2026 Workshop LP4FM
Subjects: Computation and Language (cs.CL)
Cite as: arXiv:2610.02926 [cs.CL]
  (or arXiv:2610.02926v1 [cs.CL] for this version)
  https://doi.org/10.48550/arXiv.2610.02926

arXiv-issued DOI via DataCite (pending registration)

Submission history

From: Riju Marwah [view email]
[v1] Fri, 2 Oct 2026 07:16:48 UTC (222 KB)

来源:arXiv:cs.CL · arxiv.org