跳到正文
原文
Anthropic:The Institute(旗舰研究长文 · 网页)·· 2 小时前精选AI 评分72

Anthropic 发布政策提案:建议政府有权阻止危险 AI 模型部署

Policy on the AI Exponential

AI 导读

Anthropic 发布政策提案,建议政府获得法律授权以阻止或威慑最强大 AI 模型的危险部署,并配套与全球年收入挂钩、随违规累进的民事罚款。

推荐理由

Anthropic 以当事方身份提出联邦监管框架,给出 10²⁵ FLOPs 等具体门槛和四类灾难性风险,读者可据此了解前沿 AI 监管的一种具体方案。

正文 · AI 翻译

Anthropic 的高级 AI 框架

阅读高级 AI 安全框架 →

我们发布这份提案,阐述政府应如何应对最强大 AI 模型带来的灾难性风险,包括赋予其法律权力以阻止或威慑危险部署。

AI 能力正呈急剧上升趋势。几年前,AI 模型几乎无法编写代码。今年,Claude Mythos Preview 发现了数千个高危漏洞,涉及所有主流操作系统和浏览器。证据强烈表明这一趋势将持续下去——随之而来的是,灾难性危害的风险也将增加。

这需要政府采取行动并进行监管——监管须经过精心设计,以防止政府过度干预并保护创新。当模型构成此类风险时,政府应拥有法律权力阻止或威慑其部署——超越现行法律或国会现有提案中的规定——并处以与全球年收入挂钩、随屡次违规而升级的民事处罚。前沿 AI 开发者应必须对这些模型进行测试,向公众透明地披露其发现,将其提交独立评估,并维持健全的安全计划。

这些规则应仅适用于使用超过 10²⁵ 次浮点运算(FLOPs)训练的模型,且由 AI 相关收入超过 5 亿美元或 AI 研发支出超过 10 亿美元的公司开发。它们将应对四类灾难性风险:

  • 生物风险。如果 AI 系统在没有保障措施的情况下发布,开发生物武器可能会变得容易得多。加速药物研发的同样能力,可以被用来让攻击者更廉价、更容易地开发危险病毒。
  • 网络风险。前沿 AI 模型如今能够大规模发现关键软件漏洞。用于防御时,这些能力可以保护关键系统,但它们也提高了保护医院和电网等关键基础设施的风险。
  • 失控风险。随着 AI 系统不断改进,控制那些脱离开发者掌控而行动的系统可能会变得困难得多。
  • 自动化研发。AI 系统正在自动化 AI 自身的研发,这可能进一步放大上述三类风险。

近期有几项州法律要求公司描述其安全实践并公开分享。Anthropic 支持这些法律。但加速的迅猛步伐意味着仅靠透明度已不再足够。政府需要发挥更实质性的作用。

我们的框架主要针对美国联邦政府而写。但应对 AI 风险不能等待华盛顿的行动。我们认为,除非国会颁布至少与我们今天提出的框架同样强有力的联邦法律,否则不应优先于州法律。优先权威力强大,因此应精准使用,允许各州就所有问题——如儿童安全和消费者保护——进行 AI 监管,这些问题不属于联邦法律所涵盖的特定安全职能。

我们的框架全文可在此处查阅。下面,我们概述其关键建议。

对前沿开发者的要求

透明度。前沿开发者应测试其模型并发布结果摘要。他们应发布安全框架,说明如何评估灾难性风险,并发布系统卡,评估其前沿模型的能力和风险。加州和纽约州法律已对此作出要求。但我们的框架更进一步,要求开发者还定期发布风险报告,描述其整体风险态势,并定期引入独立评估者。

独立评估。前沿开发者应至少聘请一家合格的独立评估者,对其评估和风险报告发布审查意见。与此同时,政府和行业应通过为独立评估者制定标准,并确保他们获得资金和充分接触前沿模型的机会,来发展合格独立评估者的生态体系。

安全。模型权重和训练基础设施是网络攻击者的宝贵目标,包括资源雄厚的国家行为体。前沿开发者应保护其整个开发环境,防范来自公司外部和内部的威胁。他们应公开概述其计划,应要求向指定机构分享细节,建立向该机构报告模型蒸馏攻击的渠道,并定期测试自身防御。

有牙齿的执法与监管权力。政府应能够阻止或威慑部署构成重大灾难性伤害风险的模型。我们也必须避免过于宽泛或严厉的监管权力。我们的框架既提出了阻止危险部署的机制,也提出了防止该权力被滥用的具体保障措施。政策制定者可以从较温和的方式入手,然后随着模型能力进步和评估生态成熟而调整。

社会韧性

在框架的后半部分,我们为政府提出了增强社会对模型可能带来风险的韧性的建议。

在生物领域,我们建议采取预防措施,如基因合成筛查;检测措施,如早期预警生物监测以发现新型疫情;以及准备措施,如储备防护装备和抑制空气传播的手段。

在网络领域,我们建议加固互联网所依赖的软件,为关键基础设施运营者部署技术支持,并更换关键基础设施中的遗留软件系统。在测量和态势感知方面,我们建议在政府内部设立专门职能,跟踪前沿网络能力。我们还建议政府和行业共同开发模型保障措施,以便网络能力能够广泛共享。

针对失控和自动化研发风险的韧性议程尚不成熟。我们正在积极研究这一问题,但整个领域还需要更多工作。我们迄今已识别出的有希望的方向包括:发展检测和响应脱离开发者控制的AI系统的能力,以及建设遏制或关闭此类系统的基础设施。

下一步

这些问题既复杂又新颖,我们预计围绕我们提出的建议将展开激烈辩论。但我们敦促政策制定者现在就积极参与这些问题。未来几个月,AI 能力将迅速提升。其治理需要跟上步伐。

你可以在这里阅读完整的政策框架。

来源:Anthropic:The Institute(旗舰研究长文 · 网页) · anthropic.com