跳到正文
热点事件持续更新

LLM在无有效选项MCQA中的弃答可靠性研究

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

韩国研究者Jinhyeok Kim与Hye-Young Jung在arXiv发表论文,提出"惩罚框架下的无有效选项MCQA",用MMLU-Pro数学子集移除正确选项,允许模型选择剩余选项或输出ABSTAIN,并对无效强制选择施加惩罚。 实验显示,即便有明确的无有效选项指令和惩罚评分,模型仍在部分原本答对的题目上给出无效强制选择,说明高MCQA准确率无法完全保证弃答可靠性。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.AI
    惩罚框架下的无有效选项 MCQA:分析 LLM 在无效选项下的弃答行为

    研究提出"惩罚框架下的无有效选项 MCQA",用 MMLU-Pro 数学子集移除正确选项,允许模型选择剩余选项或输出 ABSTAIN,并对无效强制选择施加惩罚。实验显示,即便有明确的无有效选项指令和惩罚评分,模型仍在部分原本答对的题目上给出无效强制选择,说明高 MCQA 准确率无法完全保证弃答可靠性。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。