跳到正文
原文
上海人工智能实验室 InternLM:原创项目· InternLM·· 2026-06-16AI 评分32

InternLM 发布 RNGBench:评估多模态大语言模型在可控非马尔可夫博弈中的表现

InternLM/RNGBench

AI 导读

上海人工智能实验室 InternLM 项目开源 RNGBench,用于在可控非马尔可夫博弈中评估多模态大语言模型,相关论文已被 EMNLP 2026 收录。该基准聚焦"超越当前观测"的评测场景,官方实现已随项目公开。

来源:上海人工智能实验室 InternLM:原创项目 ·