跳到正文
热点事件持续更新

审计质疑 HELM Safety 安全基准有效性

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

一项心理测量学审计发现,HELM Safety 中可能对应"有害拒绝"的四个数据集里,有三个已饱和,剩余数据集 HarmBench 经多维项目反应理论建模后,强烈表明其并未测量单一属性。 差分项目功能分析还发现,来自不同开发者的模型在拒绝能力相同时,部分题目得分仍存在差异。研究者称,这种模式与聚合效应一致,但不足以排除开发者间的领域差异。 研究者指出,任何对数据集和题目求平均的安全评分都可能掩盖饱和并混淆不同行为。该研究由 Christopher M. Stewart 等作者发布。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.AI
    研究质疑 HELM Safety 能否测量单一"有害拒绝"属性

    一项心理测量学审计发现,HELM Safety 中可能对应"有害拒绝"的四个数据集中有三个已饱和,剩余数据集 HarmBench 经多维项目反应理论建模后,强烈表明其并未测量单一属性。差分项目功能分析还发现,来自不同开发者的模型在拒绝能力相同时,部分题目得分仍存在差异,这种模式与聚合效应一致但不足以排除开发者间的领域差异。研究者指出,任何对数据集和题目求平均的安全评分都可能掩盖饱和并混淆不同行为。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。