物理学家 Matthew Schwartz 分享用 Claude 和 BootLoops 做跨学科科研的方法
Oct 1, 2026ScienceClaude-shaped science
哈佛物理学家 Matthew Schwartz 在 Anthropic 客座文章中提出,与其纠正 Claude 不如寻找适合当前 LLM 能力的 Claude-shaped 问题,并为此构建了开源工具包 BootLoops。
作者亲历三个月跨 18 个领域的实践,给出寻找 Claude 擅长问题的方法、失败模式和专家协作经验,可迁移到科研工作流。
摘要:在这篇客座文章中,Matthew Schwartz 教授再次撰文,介绍一种加速科学研究的 AI 新方法。在 Vibe Physics 中,Schwartz 讨论了 Claude 与物理学研究生在能力上的相似之处。在这里,他描述了当他不再与 Claude 对抗,而是让 Claude 去寻找“Claude 形状”的问题——即最适合当前一代 LLM 工具能力的问题——时所发生的情况。这促使他构建了 BootLoops,一个用于定量科学中精确计算的工具包。由于类似的计算常常出现在差异极大的科学领域中,Claude 发现了与生态学、群体遗传学以及其他十几个领域的联系。这些联系在技术上往往正确,但起初在科学上并不引人注目,因此 Schwartz 与领域专家合作,引导 BootLoops 去解决那些领域真正关心的问题。下面,我们将分享更多关于这些项目以及 BootLoops 如何诞生的内容。
Agentic AI 正在迅速进步。每个人都注意到这些模型似乎更聪明了:它们知道得更多,犯的错误更少,想法也更好。如果你顺着趋势线看,很容易自信地谈论 AI 彻底改变科学的潜力。然而,试图在自己工作中使用这些模型的学术科学家常常感到一种脱节。这些模型或许正在解决具有挑战性的、长期存在的问题,但到目前为止,这些大多只是对现有技术范围明确的应用。许多头条新闻似乎都出现在数学领域,而数学是科学中唯一可以完整陈述问题并绝对检验答案的部分。但大多数科学并非如此。而且对我们许多研究人员和学生来说,那些头条新闻与我们在使用这些模型时实际发生的情况之间的差距,会让我们感到沮丧和焦虑。
在我看来,核心冲突在于:尽管这些模型非常出色,但像人类科学家那样工作并不是当前 LLM 最擅长的事。Claude 和 GPT 擅长科学,但它们不是科学家:没错,它们很聪明,但要让它们产出任何有科学价值的东西,可能需要大量手把手引导。物理学家会把这称为“阻抗失配”:两个系统各自运行良好,但彼此匹配很差,因此一方输入的大部分内容永远无法传递到另一方。在这里,失配存在于科学家想要的东西和 AI 擅长的事情之间。
那么,我们该如何解决这个问题?
我开始寻找阻抗失配不那么严重的例子。我首先让 Claude 构建一套易于使用的数学物理工具。不久之后,这些工具就在其他问题上找到了用途。这个迭代过程产生了一套软件和科学协议,我称之为 BootLoops。BootLoops 的作用有点像 LLM 的挽具,就像 Claude Code 或 Claude Science 是 Claude 的挽具,或者 Codex 是 GPT 的挽具一样。我发现 BootLoops 特别适合科学中的一类定量问题。它也是开源的,因此可以与你喜欢的任何模型一起使用。

一旦 Claude 有了 BootLoops,它就不断注意到同一个模式:许多领域存在的问题,只要有人知道数学、物理或计算机科学中的某项技术存在,就能直接解决。我开始把这些称为“Claude 形状”的问题,并跟随它们走出高能理论物理——我的主场——进入地质学、生物学、经济学和语言学。在这些其他领域,我无法依靠自己的专业知识来判断 Claude 发现的东西是否有趣。于是我找到一些专家并请教他们。在他们的指导下,BootLoops 得以在许多研究领域取得实质性进展。
下面,我分享 BootLoops 是如何诞生的,描述一些在我一直应用它的领域中的早期发现,并分享一些我关于如何解决当今人类科学家与 AI 科学家之间阻抗失配的思考。
Claude,来掌舵!
去年十二月,我尝试了把 Claude 用作研究助手,发现 Claude Opus 4.5 的表现就像一个出色的研究生,速度却是其 20 倍。尽管 Claude 在实验结束时产出了一篇高质量论文,但走到那一步却是一场苦战。我不得不纠正它写的每一句话,把它从无关的思路上引开,并把它从死胡同里拉回来。
今年夏天,我尝试了不同的做法:不再把 Claude 当作我希望它成为的合作者,而是开始把它当作它实际上的合作者。这需要寻找适合其优势的问题。目前,Claude 还无法帮助我解决深层的概念性问题——但它在所有领域拥有几乎无限的知识广度、令人惊叹的编程技能、数学和统计学的前沿知识,以及以机器速度解析论文、附录和数据的能力。
寻找 Claude 形状问题的一个自然起点是那些编程能帮上忙的领域。当 Anthropic 在 2026 年夏天发布 Claude Fable 5 时,我想看看它的网络能力是否能转化为科学计算能力。于是,我试图通过让它移植、编写并改进我几篇论文及相邻的散射振幅文献中的各种方法来测试它。
散射振幅是我们解读大型强子对撞机数据的方式:以 13 万亿电子伏特撞击两个质子,振幅就是碎片与碰撞产生的任何新粒子(希格斯玻色子或某种未知粒子)之间的理论桥梁。其核心是费曼图,即一种特定形式的多维积分。我们现在正苦苦应对的那些积分,每一个都可能是一篇博士论文,或让一个研究小组耗费数年。
在过去20年里,一种替代方法发展了起来:S矩阵自举。在自举方法中,你不是硬算出积分,而是施加物理约束,直到只剩一个可能的答案。知道振幅在何处发散(即其“奇点”)也许能把它缩小到20,000种可能;一个对称性把它削减到500种;如此继续,直到只剩一个。传统的自举是纯解析的,并且在对称性最高的理论中走得最远,那里的约束一路收紧到只剩一个选项(N=4超杨–米尔斯理论中的九圈振幅就是一个例子)。而更接近真实世界时,你往往在到达终点之前就用完了约束。一个更新的支点——半数值自举——在你还能以荒谬的精度(有时1,000位数字)计算少数几个点处的振幅时,补上了这一缺口:如果剩下的可能选项足够少,这些数字就能精确地确定余下的系数。
半数值自举似乎非常适合智能体AI。它动用了没有任何一个人已完全掌握的数学、物理和计算机科学;它需要大量编码和算法开发;而且它是可检验的,因为同样的数值计算让任何人,无论是不是专家,都能通过运行两个脚本,按自己想要的任意位数,将最终答案与积分进行核对。这个共同体的专业知识分布也不均衡:好想法散落在Wolfram Language、C++、Python或Julia中,还有更多则存在于完全没有代码的论文里。因此,我给Fable 5的第一个任务就是把这一切移植到一个共同框架中,并写出那些论文从未提供的代码。
Claude毫不费力地做到了这一点。让我惊讶的是,它在大约20分钟内复现了我论文中的结果,而我为做到这一点所写的代码花了我好几周。不过,当它告诉我,我正在以非常低效的方式做某件事,而且存在一种我并不知道的更好算法时,我并不惊讶。
然后,我让Claude去寻找它可以计算的未解决振幅。事实证明,对S矩阵自举来说足够简单的问题,对人类来说也足够简单——而且事实上,大多数都已经做完了。尽管如此,它还是找到了几个未解决的问题。在与模型进行了一些讨论之后,事情变得很清楚:Claude把自己限制在具有最简单函数族的振幅上,也就是对数。于是我问,它能不能对下一个最简单的函数族——椭圆函数——做同样的事?
椭圆积分真的很难,即使对我这样把大量时间花在计算积分上的人来说也是如此。迄今为止,只有少数椭圆费曼积分被计算出来,而且据我所知,或者据Claude所知,没有一个完全是通过自举完成的。问题不在于这些方法行不通,而在于没有人尝试过,因为这样做所需的专业知识分散在许多人身上。相比之下,Claude轻松地把它为对数情形移植并构建的全部机制推广到了这些其他积分类。这一次,大部分软件是它自己写的,或者是从数学而非物理中借来的。随着工具包不断扩展,它开始一个接一个地攻克积分。很快,我们就有30个积分被端到端地BootLoop完成,其中包括用这种新方法复现的15个已知结果,以及15个此前从未被计算过的结果。
这一切都只是在几周之后。起初,我以为只要就此写一篇报告就会满足,但我太想看看我们(也就是我和使用 BootLoops 的 Claude)还能做些什么。
“I know Kung Fu”
科学的一个偶然特性是,同样的方程常常在不同情境中反复出现。例如在物理学中,扩散方程、福克-普朗克方程和薛定谔方程都具有相同的数学形式,因此如果你开发出一种方法来解决一个问题,往往可以将其应用于许多其他问题。我知道 BootLoops 擅长的计算在其他领域也有用武之地:例如宇宙学和弦理论。我不知道、但 Claude 乐于告诉我的是,这些积分也可以映射到群体遗传学中的贝叶斯证据积分,或者用于费曼积分约化的有限域方法也可以应用于进化生物学中的问题。
这开启了一段特别多产的时期,专门寻找并解决 Claude 形状(更狭义地说,BootLoops 形状)的问题。有些想法立刻显现为绝佳的应用。例如,系统发育学研究如何利用 DNA 将物种组织成家谱树;相关的计算是贝叶斯证据积分,其输出是一个单一数字,表示候选树对观测到的 DNA 的解释程度,这正是 BootLoops 最初被构建来做的那种积分。随着想法不断涌现,我坚持要求 Claude 既使用旧工具又构建新工具,以便让这套工具架不断成长。每一个工具,哪怕来自失败的项目,都打开了新的大门。Claude 变得越来越有能力。就像《黑客帝国》中尼奥从功夫下载中醒来之后那样。
然而,随着这些项目逐渐偏离我的专业舒适区,我开始担心。当 Claude 声称它在我领域内做的某件事很棒时,我能判断那是真是假(通常不是真的)。但当它声称它在另一个领域做的某件事很棒时,我发现自己会同意。我的怀疑加剧了,我知道我需要请一些专家来确认。果然,我发现几乎在所有情况下,Claude 在技术上是正确的,但结果并不那么有趣,直到专家帮助我们调整方向。
其中一个项目是关于生态学中的中性生物多样性理论。在任何生态系统中,有些物种繁盛,有些则消亡。中性理论追问,这种生活史中有多少是出于随机偶然。在早期工作的基础上,2001 年,生态学家斯蒂芬·哈贝尔提出了一个颇具挑衅性的观点:也许这一切都是随机的。2005 年,生态学家兰帕尔·艾蒂安为哈贝尔的理论提出了一个方程,使其(至少在原则上)能够以精确的方式接受检验。不幸的是,20 年来没有人能够大规模求解这个方程。Claude 认出艾蒂安的方程是 BootLoops 形状的,并求解了它。将该计算应用于数据后,我们确定,在地球上研究最多的森林——巴拿马运河的巴罗科罗拉多岛——中,树种组合的变化速度比中性理论所允许的快 4.5 倍。
这一结果令我兴奋不已,我把它拿给James O’Dwyer看,他是植物生物学教授,也是中性理论方面的专家。James对我很有耐心。尽管他对这一技术壮举印象深刻,但他说这些结果很可能会“被许多生态学家不以为意”。生态学家此前已经以更定性的方式观察到,中性理论跟不上真实森林的情况。但James有一个更好的主意:减去中性预测,研究剩余部分。这会让我们更好地理解哪些变化可归因于自然选择、竞争以及物种之间的差异。
James和我接着与Claude紧密合作,打造一个后继模型。James有物理学背景,因此跨学科的语言障碍更容易克服,但和许多科学家一样,他尚未真正体会到智能体式AI的力量。随着合作推进,我成了某种Claude操作员,把Claude式表达翻译给James,并让模型保持在正轨上,而James则推动模型产出生态学家可能重视的东西。最终成果是我们三个人都引以为傲的东西:一个与数据高度吻合的极简生活史预测模型。我们目前正在把该模型从巴拿马扩展到全球其他森林样地,所用数据集由Claude帮助整理。

另一个项目涉及研究群体遗传学中的精确计算,这一领域研究基因在群体内如何变异以及为何变异。Claude首先使用从数学物理引入的方法,求解了一个已有30年历史的积分表达式,该表达式描述自然选择如何塑造稀有突变。我们把它应用于gnomAD,这是最大的公开人类遗传变异目录。Claude对这一结果非常兴奋,但我并不那么确定。我不得不写信给三位不同的生物学家以求验证,之后才有一位回复,但最终我得以招募到我的同事Michael Desai,他从事这一领域,尽管不是研究这个确切问题。和James一样,Michael对技术结果印象深刻,但并不被其科学意义所说服。
不过Michael指出,更有影响力的结果可能来自使用相同或类似方法研究单条染色体上成对突变之间的相关性。在这一范围内,Claude发现并构建了新工具,比如用于数学中计算机辅助证明的不等式证书,并把它们加入BootLoops工具包。随后,我们分析了来自1000 Genomes Project的基因组中57亿对邻近突变,并发现了被称为基因转换的机制的证据。这是一个重要发现,因为几乎所有使用连锁遗传变异的分析,从群体历史到疾病定位,都忽略了基因转换。更大的教训是,AI可以帮助发现隐藏在庞大基因组数据集中的生物学信息,而公共档案中还有成千上万个这样的数据集。
其他项目也有类似的轨迹:Claude 提出一个我觉得很有说服力的初步发现。我把它带给一位专家,专家虽然不为所动,但看到了其中的潜力,于是我们一起把它打磨成有意义的科学成果。有趣的是,其中一些项目从 BootLoops 式的定量计算,逐渐转向了更一般的 Claude 式工作。例如:
- 经济学。经济学期刊现在要求作者提供复现包,而编辑往往要负责检查它。这是一项细致的手工工作。我们与两位经济学家合作,构建了一个 AI 数据编辑器:它将五家顶级期刊中 4,452 篇论文的复现包从 MATLAB、Stata 和其他商业工具移植到开源代码(约 30,000 个例程),并对照已发表的表格检查了基本上每一个可验证的数字。结果发表在 NBER 工作论文中。
- 语言学。词重音目录通常靠手工汇编,涉及几百种语言、选择效应和人为偏好。Claude 搜遍了所有公开可访问的来源,我们与三位语言学家合作,制作了 AccStack:一个覆盖 6,072 种语言的词重音数据库,几乎每一条目都引用了决定性的段落,外加一份包含 160,000 部音系学著作的参考文献目录。
还有一些额外亮点,每一项都是与专家合作完成的,且每一项都在进行进一步的探索和验证,包括:
- 系统发育学。我们让进化树的贝叶斯证据计算变得快速且可精确检验,并发现单个基因在相互竞争的树之间的支持度差异,往往小于标准采样程序的误差。
- 地球科学。我们结合了大气科学、地球化学和气候建模的方程与数据,构建了一个定量的、可预测的模型,来描述大氧化事件如何历经四次冰期展开。
- 基因组学。我们大规模研究了单细胞 RNA 计数的统计特性,以刻画爆发速率以及基因表达对教科书式电报模型的偏离。
- 太阳黑子。我们运用人类人口统计学的方法推断出太阳黑子的生命周期,随后将该方法推广到表征星斑——这是许多系外行星搜寻中的一个混杂因素。
- 数学物理。我们解决了 Watson 的“最终问题”:具有三个不等跃迁速率的三维随机游走的精确返回概率,这是 George Watson 自 1939 年开始研究的最后一个晶格积分。
- 宇宙学。我们构建了一套完整的理论工具包,用于将宇宙学参数拟合到宇宙大尺度结构的数据,包括完整的双圈功率谱和单圈三谱。
- 统计学。混合模型以难以处理而著称;我们推导出了其贝叶斯证据的精确近似,使模型选择变得实用,应用范围从生物统计学到文本分析。
总体而言,这种迭代改进 BootLoops、寻找 Claude 式应用、并与专家一起推进到科学前沿的方法,成果惊人地丰硕。关于这些项目及其他项目的更多信息,可以在 bootloops.ai 上找到。
技术细节
同时推进多个项目(三个月内,在约 400 个候选问题中,于 18 个领域完成 36 篇手稿,涉及 19 位合著者)需要大量协调,无论对我还是对 Claude 都是如此。让这一切变得可控的配置其实相当简单。Claude Code 会话全部运行在 Google Cloud 虚拟机上的终端中,并根据合作者的偏好链接到不同的 GitHub 和 Overleaf 仓库。我为每个项目设立单独的会话,另有一个主会话负责协调其他会话、分配算力并验证结果。每个会话都包含在后台运行计算的智能体,中间结果存储在各文件夹中的 markdown 文件里。这些子智能体很有用,因为我经常遇到 Fable 5 的 分类器; 这些拦截不会破坏我的整个会话,而只是关闭单个智能体。我也有单独的会话用于撰写结果;创建 GitHub 仓库、工具手册和 BootLoops 网站;编写并验证所有独立的工具代码;以及作为对抗性裁判反复检查结果。
不过,这些会话仍然需要大量引导。例如,Claude 没有时间概念,而且喜欢夸张。一个项目结束时,它告诉我“Matt——公式解出来了。两年的战役,四次深入行军,……”。而它其实只工作了三天。当我询问预计完成时间时,估计值总是要么太长,要么太短。我试过告诉 Claude,在运行测试确认之前不要给出估计,但效果也不好。随着时间推移,我开始自己摸索出事情大概需要多久,因为我无法依赖 Claude 告诉我。
更大的问题是,Claude 的默认做法似乎是硬啃一个长达数天的计算,而不是构建一个新工具,让同样的计算只需几分钟。一次又一次,我不得不告诉它要更聪明地思考,而不是更费力地思考。在这些长期项目中,压缩经常会触发,导致 Claude 丢失重要上下文。为防止这一点,我让 Claude 定期整理并合并其文件,这样它始终能访问最新版本的计划。我已经把协议技能和其他工具写进 BootLoops 框架来解决这个问题。其中一些问题在优秀的商业框架中也已得到解决,比如 Claude Science。但许多问题只是当前这一代智能体 AI 固有的恼人之处,我预计模型最终会超越它们。
以下是我遇到的另外几种失败模式,以及应对它们的提示:
- Claude 喜欢宣布胜利。“完成了,只有一个星号”往往意味着“根本没完成”。“完全就是这样,只有一处小改进”通常意味着“不”。给 Claude 设定清晰而严格的成功标准有助于解决这个问题。在一个项目中,它对自己的证明很自豪,直到“一个未证明的引理”。那个引理就是整个证明!我说不允许有未证明的引理。然后它又说“完成了”,但这次多了一条新公理。
- 一切都要自己看。我总是要求看图表。即使设置了我所有的监控,我发现自动检查仍然不可信。要警惕“吻合良好”这类定性说法。
- 质疑结论。Claude 擅长执行计算,但它得出的结论可能是错的。让它解释它发现了什么,直到你相信为止。
- 提供品味。Claude 能找到 Claude 形状的问题,但这样的问题有成千上万,甚至数百万个。Claude 似乎偏爱那些古老、被高度引用却早已被遗忘的争论。让它专注于新可能的事物,而非仅仅更快或涉及更多位数的事物,会有所帮助,但你仍然无法信任它对某件事是否有趣的判断。
- 追问。一旦 Claude 给出了一个很棒的结果,就要求一个更棒的。它总能想出点什么,偶尔还会非常精彩。
- 当心无休止的消耗。说实话,我从未成功让 Claude 准确估算时间。相反,我培养出了一种感觉,知道一件有趣的事应该花多长时间,并学会了判断 Claude 是否在我认为合理的时间尺度上取得了进展。如果你放任不管,模型会永远磨下去。
还值得一提的是,这些项目对算力和 token 的消耗都很大。对我来说,部分开销来自尝试构建能超越任何单一项目的工具:连接不同领域,并组装出一个别人可以接手的工具包。我希望 BootLoops 框架能被广泛用于定量科学,而不必让每个用户都从头重建一切。智能体 AI 让连接想法和共享代码库变得更容易,如果我们学会利用这一优势,整个社区就能比任何个人单独行动走得更快。
展望
无论模型变得多么聪明,大多数科学进步都来自必须获取、理解和核验的真实世界数据,每一轮都会引出下一个问题。AI 可以置身于这个循环之中,这确实很有价值,但它并不会把循环压缩成一个点。理解是一点一点积累起来的,每一步都建立在前一步之上;癌症的治愈方法或聚变反应堆也将以这种方式到来,而不是来自一次提示。
对千禧年大奖难题和“大科学”的关注,也许正如 Claude 喜欢说的那样,是一把“自伤枪”:一种容易让你搬起石头砸自己脚的特性。这里的风险在于,不切实际的期望可能会打击那些已经可能实现的高效用途。真正的进步很可能会一如既往地到来:通过加强科学研究的基础,并在其上构建日益复杂的应用。它会被大幅加速——正如我所描述的工作所展示的那样——但我看不到任何证据或必要去重新审视科学方法。
我喜欢的一个有时用于讨论 AI 科学的术语是凸包。取一个形状,用直线连接它的每一对点;你得到的新形状就是包含原形状的最小凸形状:它的凸包。科学现在非常割裂:到处都是参差不齐的前沿。生物学朝一个方向突出,数学朝另一个方向。一个实验室可能花 20 年时间,用他们掌握的一种方法彻底研究一组基因,而邻近的基因和替代方法却无人问津。像 BootLoops 这样的框架可以连接这些点,填补凸包。

事情变化得太快,几乎不可能提前规划。为什么要申请三年的经费去计算一个 AI 模型可能一夜之间就能解决的问题?我仍然不知道该如何培养研究生。自从我发表了那篇关于氛围物理学的文章以来,这种感觉只会变得更加尖锐。在某些领域,比如计算机科学,这种颠覆简直令人恐惧。两年前,我会把“工程师 Python 入门”课程列为必修。如今,它已经没有必要了。我花了大量时间研究机器学习,构建模型来研究各种物理现象。现在,所有这些模型都可以由 AI 构建,所以即便是学习神经网络的来龙去脉,用处也有限。只要告诉 Claude 去找到最先进的机器学习方法,它就会替你完成。
我认为 BootLoops 表明,如果你找到了正确的问题,解决它的许多技术性工作如今都可以自动化。从某种意义上说,这是一种解放。但概念性的部分仍然需要人类。正因如此,我希望我们能找到一种方式,让人类即便在 Claude 形态的科学中也能获得应有的认可。奇怪的是,AI 有可能颠倒通常的商业模式——在那种模式里,身处顶层的人获得荣誉,而亲手解决问题的人却一无所得。我不知道这会如何解决,但假装人类的贡献就是打字,是解决不了的。
那么,这让普通科学家 Joe Scientist 处于什么境地?要我说,其实处境很好。我们现在触手可及的工具,能以闪电般的速度在看似棘手的问题上取得进展。我可以预见,在系统生物学这类数据丰富但理论匮乏的领域,即将出现巨大的增长。我也很容易想象,人类的心智能从计算和分析的乏味中解放出来,去做方向和指导这类更深层的智力工作。最重要的是,我期待科学家们走出自己的地盘,去寻找协同与合作,就像我在 BootLoops 中所做的那样。专注于 Claude 形态的科学,最令人耳目一新的结果是,它帮助我们领会人类形态的科学是什么样子。
关于 BootLoops 框架及其所促成的科学的详细信息,可在 www.bootloops.ai 找到。BootLoops 框架已在 GitHub 上发布,供任何人使用和贡献。
致谢
如果没有我的人类同伴们的指导和合作,我与 Claude 和 BootLoops 一起产出的科学成果绝不会如此有趣:Isaiah Andrews、Nima Arkani-Hamed、Michael Desai、Scott Edwards、Noam Elkies、Cecilia Garraffo、Matthew Gordon、Thomas Grimm、Martin Hemberg、Mikhail Ivanov、David Johnston、Gary King、Paul Lewis、Brendan Meade、Amara McCune、Joe Pater、Subhabrata Sen、Siddharth Mishra-Sharma、James O’Dwyer、Kevin Ryan、Jesse Shapiro 和 Xiaoyuan Zhang。
披露
在这个项目期间,Schwartz 一直在 Anthropic 担任访问研究员。BootLoops 不是 Anthropic 的项目;它由 Matthew Schwartz 拥有和维护。
相关内容
机器人能做什么工作?
我们建立了一个指数,衡量当今机器人执行美国工作任务的能力。机器人已经能完成四分之三的体力任务,大多是在受限环境中,但仅在 0.3% 的任务上具有成本竞争力。
你想从 AI 得到什么?
我们正在启动一项新研究,使用 Anthropic Interviewer 来了解你与 AI 相处的经历,诚邀你参与。
GLM-5.3 与高级网络能力的扩散
与 Claude Mythos Preview 一样,GLM-5.3 具备自主构建端到端网络攻击漏洞利用的强能力。但 GLM-5.3 与其他前沿模型不同之处在于,它发布时没有设置有意义的防护措施来限制滥用。
来源:Anthropic:Research(发表成果 · 网页) · anthropic.com