OpenAI 发布 Model Spec 模型行为规范
OpenAI 在官网发布 Introducing the Model Spec,介绍其 Model Spec 文档。因抓取失败仅标题可用,正文细节暂缺。
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
OpenAI 在官网发布 Introducing the Model Spec,介绍其 Model Spec 文档。因抓取失败仅标题可用,正文细节暂缺。
OpenAI 封禁了与俄罗斯来源的 "Doppelganger" 行动相关的账号,该行动利用 AI 生成针对乌克兰的反乌社交媒体评论、翻译和多语言网站文案。
推荐理由:OpenAI 官方披露封禁行动细节,读者可借此了解 AI 被用于影响力操作的典型手法与平台处置方式。
OpenAI 发布公告,宣布破坏国家关联威胁行为者对其 AI 的恶意使用。正文抓取失败,仅标题可用,更多细节以原文为准。
推荐理由:OpenAI 官方通报针对国家关联威胁行为者的处置行动,可了解 AI 滥用与平台安全治理的一手动态。
OpenAI 与 DeepMind 安全团队合作开发一种算法,通过让人类判断两个候选行为哪个更好来推断人类意图。该工作旨在免去人工编写目标函数,避免用简单代理近似复杂目标时引发危险行为,是构建安全 AI 系统的一步。
推荐理由:OpenAI 与 DeepMind 安全团队合作的算法,通过人类偏好比较推断目标,减少人工写目标函数带来的风险。