OpenAI 联合多家机构发布论文,预测 AI 的恶意使用风险及防范措施
OpenAI 联合 Future of Humanity Institute、Centre for the Study of Existential Risk。
推荐理由:OpenAI 与多家机构合作发布预测 AI 恶意用途的论文,读者可从中了解威胁类型与对应的防范缓解思路。
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
OpenAI 联合 Future of Humanity Institute、Centre for the Study of Existential Risk。
推荐理由:OpenAI 与多家机构合作发布预测 AI 恶意用途的论文,读者可从中了解威胁类型与对应的防范缓解思路。
OpenAI 与 DeepMind 安全团队合作开发一种算法,通过让人类判断两个候选行为哪个更好来推断人类意图。该工作旨在免去人工编写目标函数,避免用简单代理近似复杂目标时引发危险行为,是构建安全 AI 系统的一步。
推荐理由:OpenAI 与 DeepMind 安全团队合作的算法,通过人类偏好比较推断目标,减少人工写目标函数带来的风险。
OpenAI 与 Berkeley、Stanford 研究者共同署名 Google Brain 研究人员主导的论文《Concrete Problems in AI Safety》。论文探讨了让现代机器学习系统按预期运行的多项研究问题。
推荐理由:OpenAI 联合 Berkeley、Stanford 研究者参与 Google Brain 主导的论文,读者可从中了解 AI 安全的具体研究问题方向。