OpenAI 公布应对 EU AI Act 的文本水印方案 textGrain
Our approach to EU text provenance rules
OpenAI 公布应对 EU AI Act 的文本水印方案:API 客户即日起可对部分模型选择开启水印,未来数周内欧盟的 ChatGPT 和 Codex 文本输出将加入隐形水印,检测器初期仅向获批研究人员和专家机构开放。
原文给出 textGrain 的检测数据和局限,读者可以据此判断文本水印在 EU AI Act 合规中的实际可用性。
我们对欧盟文本来源规则的应对方式
在当今技术能力范围内提升透明度。
加载中…
分享
内容来源帮助人们了解内容的来源、创建或编辑方式,以及是否包含与我们模型相关的信号。我们已公开提供工具,用于识别由我们模型生成的图像和音频。今天,我们分享针对欧盟《人工智能法案》的文本水印方案,以及它如何融入我们更广泛的工作。
欧盟《人工智能法案》要求生成式人工智能提供商以机器可读的方式识别生成的文本。文本水印和检测仍属早期技术,存在显著局限,关于其益处和负责任使用的观点也仍在发展中。我们的分阶段方案既反映了欧盟《人工智能法案》的要求,也兼顾了该技术的局限性,并着重于说明文本水印能告诉人们什么、不能告诉人们什么:
从今天起,全球 API 客户可以针对部分模型选择启用文本水印。文本水印在 API 中默认保持关闭。
在未来几周内,我们将为欧盟地区符合条件的 ChatGPT 和 Codex 文本输出添加不可见水印。
我们开放文本水印检测器的申请。访问权限最初将仅限于经过批准的研究人员和专家组织,他们能帮助我们评估并改进这项技术。
- 以上仅适用于文本来源——我们用于音频和图像的验证工具,包括我们的 openai.com/verify 网页工具和 内容来源 API(在新窗口打开),将继续向希望了解图像或音频文件是否由我们系统生成的组织公开开放。
我们的水印如何工作与表现
我们的文本水印技术 textGrain 会在模型的用词选择中添加一个不可见的统计信号。我们的检测器会寻找该信号,以评估一段文本是否包含 OpenAI 水印。有关 textGrain 工作原理的更多细节,请参阅我们的技术报告(在新窗口打开),该报告将在未来几周内更新更多细节。我们还计划将该技术开源,以便他人在此基础上继续开发。
在我们的评估中,textGrain 达到或超过了我们测试的其他方法的表现,包括用于文本的 SynthID。即便如此,理想条件下的强劲表现并不保证在日常使用中能可靠检测。
检测器可能犯两类错误:它们可能报告并不存在的水印——即假阳性——或漏掉存在的水印——即假阴性。我们下方的评估说明了其中一些挑战:
更短或受限更多的文本更难检测。在 1% 的目标假阳性率下,对于心理学等内容,我们的检测器在约 80% 的 200 个 token 段落中识别出了水印,而 400 个 token 段落的识别率约为 95%。对于数学等用词灵活性较低的内容,检测率则大幅降低。
编辑会削弱水印。在一项针对 400 个 token 段落的评估中,将 10% 的词语替换为同义词会使检测率从约 92% 降至 66%。替换 25% 的词语则会降至 17%。
这些限制促使我们决定仅向经过批准的研究人员和专家组织提供初始检测器访问权限,他们可以帮助我们评估可靠性和负责任的使用方式。
此图表展示了针对来自 ELI5 数据集(在新窗口中打开)的数学和心理学问题的带水印回复结果,目标误报率为 1%。检测效果随文本长度提升而改善,但对于措辞灵活性较低的内容(如数学),整体检测率显著更低。
编辑会大幅削弱水印信号。此图表展示了替换段落中 10% 或 25% 的词语如何影响检测。结果基于对来自 ELI5(在新窗口中打开)问题的带水印英文回复。
水印对输出质量的影响
在用于评估我们最新前沿模型 Astra 的各项基准测试中,我们没有发现带水印与不带水印之间存在有意义的性能差异。
| 基准测试 | 无水印文本(Astra,max) | 带水印文本(Astra,max) |
|---|---|---|
| Artificial Analysis Intelligence Index | 49.57 分 | 49.76 分 |
| AutomationBench | 34.09% | 34.86% |
| DeepSWE v1.1 | 72.80% | 71.68% |
| Terminal-Bench 4.0 | 53.90% | 56.06% |
| Terminal-Bench Science 0.1 | 56.90% | 60.00% |
| BrowseComp | 87.92% | 87.35% |
| HealthBench Professional | 64.27% | 64.60% |
| GPQA Diamond | 94.44% | 93.94% |
文本水印无法告诉你什么
文本水印只能有限地说明我们的系统在某段文字中所起的作用。理解从检测结果中能得出和不能得出哪些结论很重要。
水印并不衡量人类的贡献。它可以表明 OpenAI 系统生成或处理了某段文字的一部分,但无法说明其中包含多少人类判断、编辑或创意。
水印并不确立所有权或责任。它不能确定文本归谁所有、其使用是否合法、是否需要披露,或由谁负责。
水印并不识别用户。它不会将某个人、组织、账户、提示词或对话与该文本关联起来。
水印并不验证准确性。它不会告诉你某段文字是否真实、是否具有误导性、是否有害,或是否置于正确的语境中。
未检测到水印并不能证明是人类创作。使用 OpenAI 工具生成的文本可能因过短、经过编辑或翻译而无法可靠检测。它也可能来自不受支持的模型、早于水印功能推出,或由其他公司的工具生成。
我们的下一步计划
在欧盟推出文本水印。在未来几周内,我们将仅面向欧盟所有方案中的合格 ChatGPT 和 Codex 用户推出文本水印。在发布时,我们不会将文本水印设为全球默认。这种区域性做法让我们有空间从实际使用和反馈中学习。
为 API 客户启用可选水印。从今天起,世界各地的 API 客户将能够为部分模型选择启用带水印文本输出。这使客户可以决定水印如何契合其透明度义务以及他们为用户提供的体验。我们还在与云合作伙伴合作,在未来几周内让其服务中访问的 OpenAI 模型输出支持水印。
向研究人员和专业组织提供检测器访问权限。经批准的研究人员和专业组织可从今天起申请。根据实践准则(在新窗口中打开),访问权限最初将按个案授予,以支持文本来源的评估和改进。该工具将报告是否检测到 OpenAI 水印,而不会识别用户或披露其提示或对话。鉴于水印漏检和误报的风险,我们在发布时不会将其公开提供。
随着技术、标准和证据的演进,我们预计会重新审视这一方法的各个部分。
我们在内容来源方面的更广泛方法
单一来源技术本身并不足够,因此我们采取分层方法,结合开放标准、持久水印和验证工具。
我们为支持的图像输出添加内容凭证,符合 C2PA 标准(在新窗口中打开),在支持的图像和音频中嵌入不可见的 SynthID(在新窗口中打开)水印,并通过 openai.com/verify 和我们的 内容来源 API(在新窗口中打开)提供图像和音频验证。这些技术相互补充:内容凭证可以记录文件的来源和历史,而不可见水印可以在元数据被移除时保留信号。
正如我们在选举保障工作中所描述的,来源信息可以帮助人们和平台评估可能具有误导性的 AI 生成内容,包括深度伪造。我们将这些信号与政策、滥用检测、举报、调查和执法相结合,并与研究人员、标准机构、平台和民间社会合作,使来源信息在更广泛的生态系统中发挥作用。
将来源扩展到文本需要考虑到文本被改写、翻译或编辑的容易程度。正如我们在六月所讨论的,我们的方法必须反映当前技术的实际限制。我们将继续改进检测,研究水印如何经受编辑和翻译,并探索更有意义地区分 AI 辅助与 AI 创作的方法。我们将随着证据、标准和监管要求的演变调整方法,并在我们认为结果可以被负责任地解读时扩大检测器的访问权限。
如需了解更多信息,请访问我们的帮助中心文章(在新窗口中打开)。
来源:OpenAI:官网动态 · openai.com