跳到正文
热点事件持续更新

研究揭示代码LLM过度自信失败问题

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Ravishka Rathnasuriya 与 Wei Yang 发表研究,指出代码 LLM 存在"过度自信失败":生成的错误程序在 token 级置信度上与正确程序难以区分。 该结论覆盖四个开源代码模型和三个基于执行的 benchmark。研究发现,现有不确定性信号只能提供部分失败证据,且依赖具体模型,基于不确定性的筛选无法稳定提升接受集准确率;指令微调会增加失败生成的确定性,但不改善对正确性的判别,常见缓解手段也无法可靠解决这一问题。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.AI
    LLM 代码生成的过度自信失败问题研究

    研究揭示 LLM 代码生成存在"过度自信失败":错误程序在 token 级置信度上与正确程序难以区分,覆盖四个开源代码模型和三个基于执行的 benchmark。现有不确定性信号仅提供部分且依赖模型的执行失败证据,基于不确定性的筛选无法稳定提升接受集准确率。指令微调会增加失败生成的确定性却不改善正确性判别,常见缓解手段也无法可靠解决该问题。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。