跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

104条精选相关主题论文研究政策监管推理能力

最新精选

第 101–104 条 · 共 104 条
5月8日周三
5月1日周三
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)62

    OpenAI 封禁与俄罗斯 "Doppelganger" 影响力行动相关的账号

    OpenAI 封禁了与俄罗斯来源的 "Doppelganger" 行动相关的账号,该行动利用 AI 生成针对乌克兰的反乌社交媒体评论、翻译和多语言网站文案。

    推荐理由:OpenAI 官方披露封禁行动细节,读者可借此了解 AI 被用于影响力操作的典型手法与平台处置方式。

2月14日周三
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)72

    OpenAI 破坏国家关联威胁行为者对 AI 的恶意使用

    OpenAI 发布公告,宣布破坏国家关联威胁行为者对其 AI 的恶意使用。正文抓取失败,仅标题可用,更多细节以原文为准。

    推荐理由:OpenAI 官方通报针对国家关联威胁行为者的处置行动,可了解 AI 滥用与平台安全治理的一手动态。

6月13日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)72

    OpenAI 与 DeepMind 合作研究从人类偏好中学习

    OpenAI 与 DeepMind 安全团队合作开发一种算法,通过让人类判断两个候选行为哪个更好来推断人类意图。该工作旨在免去人工编写目标函数,避免用简单代理近似复杂目标时引发危险行为,是构建安全 AI 系统的一步。

    推荐理由:OpenAI 与 DeepMind 安全团队合作的算法,通过人类偏好比较推断目标,减少人工写目标函数带来的风险。