跳到正文
热点事件持续更新

论文:LLM激活去偏方向实为置信度

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

一篇 arXiv 论文分析大模型激活引导所用的线性去偏方向,发现其主要由模型置信度主导,指向激活空间中高概率到低概率 token 的区域,而非编码模型偏见的表征。 作者 Stephanie Buttigieg 等人称,沿该方向转向虽能降低测量到的偏见,但原因是模型在问答基准上倾向弃答,公平性指标改善只是副作用。他们认为与置信度解耦的线性偏见表征难以分离,转向式去偏的结果应谨慎解读。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    arXiv 论文:LLM 潜空间去偏方向编码的是置信度而非公平性

    arXiv 论文(arXiv:2610.08559)分析激活转向所用的线性去偏方向,发现其主要由模型置信度主导,指向激活空间中高概率到低概率 token 的区域,而非编码模型偏见的表征。沿该方向转向虽降低测量到的偏见,但原因是模型在 QA 基准上倾向弃答,公平性指标改善只是副作用;作者认为与置信度解耦的线性偏见表征难以分离,转向式去偏结果应谨慎解读。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。