研究揭示代码LLM过度自信失败问题
热点事件持续更新
研究揭示代码LLM过度自信失败问题
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Ravishka Rathnasuriya 与 Wei Yang 发表研究,指出代码 LLM 存在"过度自信失败":生成的错误程序在 token 级置信度上与正确程序难以区分。 该结论覆盖四个开源代码模型和三个基于执行的 benchmark。研究发现,现有不确定性信号只能提供部分失败证据,且依赖具体模型,基于不确定性的筛选无法稳定提升接受集准确率;指令微调会增加失败生成的确定性,但不改善对正确性的判别,常见缓解手段也无法可靠解决这一问题。
AI 根据报道生成 · 2 小时前更新
最新进展10月9日 12:00
LLM 代码生成的过度自信失败问题研究报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv:cs.AILLM 代码生成的过度自信失败问题研究
研究揭示 LLM 代码生成存在"过度自信失败":错误程序在 token 级置信度上与正确程序难以区分,覆盖四个开源代码模型和三个基于执行的 benchmark。现有不确定性信号仅提供部分且依赖模型的执行失败证据,基于不确定性的筛选无法稳定提升接受集准确率。指令微调会增加失败生成的确定性却不改善正确性判别,常见缓解手段也无法可靠解决该问题。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。