跳到正文
arXiv:cs.LG· Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, Qinrong Cui, Jan Christian Blaise Cruz, Badrinath Chandana, Peerawat Chomphooyod, Ahmed Attia, Jonibek Mansurov, Emilio Villa-Cueva, Canh Duong Nguyen, Imran Turganov, Minghao Wu, Peerat Limkonchotiwat, Irina Nikishina·· 5 小时前AI 评分44

HyperBrowseComp:面向网页浏览智能体的多语言多模态压力测试基准

HyperBrowseComp: A Multilingual and Multimodal Stress Test for Web-Browsing Agents

AI 导读

HyperBrowseComp 是一个多语言多模态网页浏览基准,包含 423 道由母语者人工编写并验证的题目,覆盖 13 种语言。题目要求定位冷门证据、追踪多步线索链或检查视频、扫描文档、图像、地图等异构来源,并通过无联网模型评估过滤掉可凭参数化知识作答的简单题。研究团队用提供商原生搜索和共享外部检索框架在统一智能体协议下评测多个模型,并对部分题目开展人工评估。

正文

Authors:Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, Qinrong Cui, Jan Christian Blaise Cruz, Badrinath Chandana, Peerawat Chomphooyod, Ahmed Attia, Jonibek Mansurov, Emilio Villa-Cueva, Canh Duong Nguyen, Imran Turganov, Minghao Wu, Peerat Limkonchotiwat, Irina Nikishina

View PDF HTML (experimental)

Abstract:We introduce HyperBrowseComp, a multilingual and multimodal browsing benchmark comprising 423 manually authored and human-validated questions across 13 languages, written by native or highly proficient speakers. Questions are designed to be extremely challenging. Each question targets a concise, publicly verifiable answer whose discovery requires locating obscure evidence, following multi-step clue chains, or inspecting heterogeneous sources such as videos, scanned documents, images, or maps. Easier questions are filtered out by evaluating them with models without internet access to reduce the likelihood that they can be answered with parametric knowledge alone. We evaluate several models using provider-native search and a shared external retrieval harness under a common agent protocol. To contextualize model performance and effort, we also conduct a human evaluation on a sample of the questions. HyperBrowseComp provides a challenging testbed for persistent information seeking across languages and evidence modalities, with difficulty arising from discovering and connecting evidence on the open web.
Subjects: Artificial Intelligence (cs.AI); Machine Learning (cs.LG)
Cite as: arXiv:2610.03574 [cs.AI]
  (or arXiv:2610.03574v1 [cs.AI] for this version)
  https://doi.org/10.48550/arXiv.2610.03574

arXiv-issued DOI via DataCite (pending registration)

Submission history

From: Alham Fikri Aji [view email]
[v1] Fri, 2 Oct 2026 16:48:49 UTC (9,698 KB)

来源:arXiv:cs.LG · arxiv.org