Answer.AI 官方研发博客(RSS)· Benjamin Clavié, Florian Brand·· 2025-06-05AI 评分46
Answer.AI 发布 ReadBench:评测视觉语言模型的文本读取能力
TIL: Vision-Language Models Read Worse (or Better) Than You Think
AI 导读
Answer.AI 推出 ReadBench 基准,将 MMLU-Redux、MMLU-Pro、GPQA-Diamond、BABILong 和 LongBench 等文本基准的上下文转为图像、问题保留为文本,评测 VLM 从图像中读取和推理文本的能力。
来源:Answer.AI 官方研发博客(RSS) · answer.ai