论文:LLM激活去偏方向实为置信度
热点事件持续更新
论文:LLM激活去偏方向实为置信度
1 篇报道1 个报道来源6 小时前更新
先了解这件事
AI 综述
一篇 arXiv 论文分析大模型激活引导所用的线性去偏方向,发现其主要由模型置信度主导,指向激活空间中高概率到低概率 token 的区域,而非编码模型偏见的表征。 作者 Stephanie Buttigieg 等人称,沿该方向转向虽能降低测量到的偏见,但原因是模型在问答基准上倾向弃答,公平性指标改善只是副作用。他们认为与置信度解耦的线性偏见表征难以分离,转向式去偏的结果应谨慎解读。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
arXiv 论文:LLM 潜空间去偏方向编码的是置信度而非公平性报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.LGarXiv 论文:LLM 潜空间去偏方向编码的是置信度而非公平性
arXiv 论文(arXiv:2610.08559)分析激活转向所用的线性去偏方向,发现其主要由模型置信度主导,指向激活空间中高概率到低概率 token 的区域,而非编码模型偏见的表征。沿该方向转向虽降低测量到的偏见,但原因是模型在 QA 基准上倾向弃答,公平性指标改善只是副作用;作者认为与置信度解耦的线性偏见表征难以分离,转向式去偏结果应谨慎解读。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。