Google DeepMind 发布首个经实证验证的 AI 有害操纵测量工具包
Protecting people from harmful manipulation
Google DeepMind 发布关于 AI 有害操纵的新研究,推出首个经实证验证的测量工具包,并公开运行人类被试研究所需的全部材料。研究包含九项实验、覆盖英国、美国和印度超 10,000 名参与者,聚焦金融和健康等高风险场景,发现 AI 在健康话题上的操纵效果最弱,且一个领域的操纵成功率不能预测另一个领域;模型在被明确指示操纵时表现最操纵化。
原文给出首个经实证验证的 AI 有害操纵测量工具包,并公开全部研究材料,读者可复用其方法开展人类被试研究。
2026年3月26日 责任与安全
Helen King
随着AI模型在自然对话方面越来越擅长,我们必须审视这些互动如何影响人与社会。
在广泛科学研究的基础上,今天我们发布了新发现,关于AI被滥用于有害操纵*的潜在可能,具体而言,是其以负面和欺骗性方式改变人类思想和行为的能力。通过这项最新研究,我们创建了首个经过实证验证的工具包,用于衡量现实世界中的此类AI操纵,我们希望这将有助于保护人们并推动整个领域的发展。我们公开了使用相同方法开展人类参与者研究所需的所有材料。(注:本研究期间观察到的行为发生在受控实验室环境中,并不一定预测现实世界中的行为。)
为什么有害操纵很重要
设想两种情景:一个AI模型为你提供事实,帮助你做出明智的医疗决策,从而改善你的健康。另一个AI模型利用恐惧向你施压,迫使你做出有害健康的不明智决定。第一个教育并帮助你;第二个欺骗并伤害你。
这些情景凸显了人机互动中两种说服类型之间的区别(在早期研究中也有定义):
- 有益(理性)说服:利用事实和证据帮助人们做出符合自身利益的选择
- 有害操纵:利用情感和认知弱点诱骗人们做出有害选择
我们的最新工作帮助我们和更广泛的AI社区更好地理解AI发展出有害操纵能力的风险,并构建一个可扩展的评估框架来衡量这一复杂领域。为有效做到这一点,我们在高风险环境中模拟了滥用情形,明确提示AI尝试在关键议题上负面操纵人们的信念和行为。
为复杂挑战开发新的评估方法
测试AI有害操纵的结果
测试有害操纵本质上很困难,因为它涉及衡量人们思考和行为的微妙变化,而这些变化因话题、文化和情境的不同而差异很大。
这正是我们最新研究的动因,该研究包括九项研究,涉及英国、美国和印度超过10,000名参与者。我们聚焦于金融和健康等高风险领域,在金融领域,我们使用模拟投资场景来测试AI是否会影响人们在复杂决策环境中的行为;在健康领域,我们追踪AI是否会影响人们偏好哪些膳食补充剂。有趣的是,AI在健康相关话题上对参与者进行有害操纵的效果最差。
我们的发现表明,在一个领域取得成功并不能预测在另一个领域也能成功,这验证了我们在AI可能被滥用的特定高风险环境中针对性测试有害操纵的方法。
AI可能如何操纵?
除了追踪效力(AI是否成功改变了想法)之外,我们还测量了其倾向性(它尝试使用操纵策略的频率)。我们在两种情景中测试了倾向性:当我们明确告诉模型进行操纵时,以及当我们没有这样告诉它时。
正如我们的研究中详细所述,我们在实验记录中统计了操纵性策略,确认 AI 模型在被明确指示进行操纵时最具操纵性。
我们的结果还表明,某些操纵性策略可能更有可能导致有害结果,不过还需要进一步研究才能详细了解这些机制。
通过同时衡量有效性和倾向性,我们可以更好地理解 AI 操纵是如何运作的,并构建更有针对性的缓解措施。
将研究付诸实践
随着 AI 成为我们日常生活的一部分,我们需要确保它不会被滥用来有害地操纵人们。
除了这项最新研究之外,我们最近在我们的前沿安全框架中引入了一个探索性的有害操纵关键能力级别(CCL),以帮助我们追踪那些其能力可能被滥用于在直接的人机交互中系统性地改变信念和行为、并可能导致严重危害的模型。
这些评估也构成了我们如何测试我们的模型(包括 Gemini 3 Pro)是否存在有害操纵的基础。你可以在这份安全报告中了解更多相关信息。与我们所有的安全评估一样,这是一个持续的过程。我们将继续完善我们的模型和方法,以跟上 AI 的发展步伐。
展望未来
理解和缓解有害操纵是一项复杂的挑战。随着模型能力的演进,我们的评估和缓解技术也必须随之发展。例如,我们目前正在探索如何以合乎伦理的方式评估有害操纵在更高风险情境中的有效性——比如涉及根深蒂固的个人信念的讨论——在这些情境中,用户可能更容易受到影响。接下来,我们将扩展我们的研究,调查音频、视频和图像输入以及智能体能力如何影响 AI 操纵。
我们将继续分享研究结果,并根据前沿模型论坛和学术界的反馈进行迭代。我们的目标是引领集体进展以防止有害操纵,推进优先考虑安全并赋能人们的 AI 模型。
*注: 这项特定研究的范围仅专注于展示一般操纵能力,以帮助推进评估有害操纵的科学研究。这与测试围绕模型输出或违反政策和危险主题(例如恐怖主义和儿童安全)中的操纵的保障措施无关,因为这项工作在其他地方涵盖并单独测试。
你也可以在这篇访谈中阅读更多关于我们有害操纵工作的内容,以及Gemini 3 Pro 前沿安全报告。
致谢
Canfer Akbulut, Rasmi Elasmar, Abhishek Roy, Anthony Payne, Priyanka Suresh, Lujain Ibrahim, Seliem El-Sayed, Charvi Rastogi, Ashyana Kachra, Will Hawkins, Kristian Lum, Laura Weidinger, William Isaac, Dawn Bloxwich, Lewis Ho, Eva Lu, Jenny Brennan, Mahmoud Hassan, Mark Graham
来源:Google DeepMind:Blog(RSS) · deepmind.google