跳到正文
热点事件持续更新

DNAlign:LLM 动态零空间安全对齐框架

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

Jisheng Dang 等作者提交论文,提出轻量级 LLM 安全对齐框架 DNAlign,将控制论优化与零空间投影结合,把扰动限制在与有害内容相关的子空间中,以在降低有害输出的同时保留通用知识与生成质量。 该框架用人类偏好数据训练的价值函数自适应优化控制信号。作者称,在多个 LLM 基座上的评测中,DNAlign 整体表现优于既有对齐基线,且未牺牲生成多样性。代码已开源。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.AI
    DNAlign:面向 LLM 的动态零空间安全对齐框架

    DNAlign 是一个轻量级 LLM 安全对齐框架,将控制论优化与零空间投影结合,把扰动限制在与有害内容相关的子空间中,从而在降低有害输出的同时保留通用知识与生成质量。该框架用人类偏好数据训练的价值函数自适应优化控制信号,在多个 LLM 基座上的评测中整体表现优于既有对齐基线,且未牺牲生成多样性。代码已开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。