跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

123条精选相关主题论文研究政策监管推理能力

最新精选

第 121–123 条 · 共 123 条
2月20日周二
6月13日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)72

    OpenAI 与 DeepMind 合作研究从人类偏好中学习

    OpenAI 与 DeepMind 安全团队合作开发一种算法,通过让人类判断两个候选行为哪个更好来推断人类意图。该工作旨在免去人工编写目标函数,避免用简单代理近似复杂目标时引发危险行为,是构建安全 AI 系统的一步。

    推荐理由:OpenAI 与 DeepMind 安全团队合作的算法,通过人类偏好比较推断目标,减少人工写目标函数带来的风险。

6月21日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)72

    OpenAI 参与 Google Brain 主导的论文《Concrete Problems in AI Safety》

    OpenAI 与 Berkeley、Stanford 研究者共同署名 Google Brain 研究人员主导的论文《Concrete Problems in AI Safety》。论文探讨了让现代机器学习系统按预期运行的多项研究问题。

    推荐理由:OpenAI 联合 Berkeley、Stanford 研究者参与 Google Brain 主导的论文,读者可从中了解 AI 安全的具体研究问题方向。