编辑|Panda
理论物理学界一项保持三年的计算纪录,被人工智能系统打破。
数小时前,Anthropic宣布:Claude在科研平台Claude Science上几乎无需人为监督,连续运行数天,成功计算出平面N=4超对称杨-米尔斯理论(planar N=4 super-Yang-Mills)中的九圈六粒子散射振幅。
这是理论物理“散射振幅”领域公认的前沿难题。此前在该模型中的最高纪录停留在八圈,由SLAC国家加速器实验室的Lance Dixon与合作者于2023年创下。
这次突破由八圈纪录的创造者亲自验证。Dixon独立核对了Claude的计算结果,并评价称,一个大语言模型能够执行完这套复杂配方中的每一步,并组织起算力,在他看来“是一场相当了不起的胜利”。他甚至直言,除了他的合作者外,Claude比任何人都更了解他们团队2019年和2023年的那两篇论文。
更令人意外的是整个过程及其成本。研究者交给Claude的仅有一句任务描述,此后的“指导”几乎只剩下“继续”;整个计算折合到普通用户身上大约为一两千美元,其中真正用于数值计算的部分只有约100美元,相当于96个CPU运行一周。而Dixon原本认为,直接计算九圈振幅难度太大,他的团队为此已经筹备了数年。
这项突破的起点,是一封公开的“挑战书”。
8月7日,前理论物理学家、科普博主Matt von Hippel在自己的博客4gravitons上发布了一篇略带挑衅意味的文章,标题是“只有AI进入我的领域才算数”。他在文中点名向AI公司下战书:用一名学者能负担得起的算力,去解决散射振幅领域一个悬而未决的大问题。
他给出了两个选项:要么将N=8超引力计算到七圈,要么将N=4超对称杨-米尔斯理论的六粒子振幅计算到九圈。
一个月后,AI完成了任务。Anthropic刚刚刊出的,正是von Hippel本人撰写的客座文章,标题就是:“是的,Claude能算九圈”。
https://www.anthropic.com/research/yes-claude-can-do-nine-loops
九圈,难在哪里?
要理解这件事的分量,得先说清楚物理学家在计算什么。
粒子物理学家预测粒子行为,依靠的是一类称为“散射振幅”的公式:给定参与碰撞的粒子的能量和动量,散射振幅能告诉你它们以某种方式发生反应的概率。
预测越精确,就越能与大型强子对撞机(LHC)这类实验的结果进行细致比对。一旦出现偏差,就可能是新物理的线索,例如暗物质的本质,或宇宙中物质与反物质为何不对称。
问题在于,散射振幅极难精确计算,物理学家几乎只能做近似。他们把计算按“圈”(loop)来分层,圈数大致衡量了粒子之间的相互作用被允许复杂到什么程度。每多加一圈,答案就更接近真实值,但计算量也随之急剧膨胀。von Hippel在挑战原文中写道,这类计算的复杂度通常随圈数呈指数级甚至阶乘级增长。
因此现实中,绝大多数散射振幅只计算到两圈,少数能到三圈。粒子物理中最精确的那个预测——电子反常磁矩,用到了五圈。
N=4超对称杨-米尔斯理论则是这个领域专门的玩具模型。“杨-米尔斯”是描述电磁力、强核力、弱核力这三种基本相互作用的理论框架;“N=4超对称”则意味着每个粒子都配有四个超对称伙伴。粒子多到不现实,这个理论并不描述真实世界。但恰恰是这种高度对称,让许多变量组合相互抵消,计算反而变得相对可控。研究者在这里打磨新方法,看它们能走多远。
这次用到的方法称为“自举”(bootstrap)。von Hippel把它比作数独:先写出答案可能的全部形式,用一套专门的“字母表”记录在计算机文件里,然后拿所有已知约束去逐一排除,包括其他方法给出的预测、答案必须遵守的规则、以及相关问题中已知的结果。理想情况下,最后只剩一个候选能通过所有检查,而且还有富余的检查条件用来确认没有算错。
八圈的纪录,Dixon是绕着路拿到的。2023年,他和Yu-Ting Liu借助一种被称为“对跖对偶”(antipodal duality)的奇特对称性,先算出相对更容易的“形状因子”(form factor),再由此换算出八圈振幅。此后几年,他的团队一直盯着九圈,计划沿用同样的间接路线。在他看来,直接去算九圈振幅太难了。
值得一提的是,von Hippel本人正是这一研究路线的老兵。他曾与Dixon等人合作,将六粒子振幅推进到六圈和七圈。换句话说,他挑的是自己亲手啃过的骨头。
一句prompt,然后不断“继续”
8月底,Anthropic的两位物理学家Liam Fitzpatrick和Siddharth Mishra-Sharma联系上了von Hippel,告诉他挑战已经被攻克。
他们使用的是Fable 5.1模型,运行在Claude Science平台上。von Hippel在文中解释,Claude Science是一种“harness”,即在大模型外面套上结构化规则和提示,让它在科研任务中表现得更稳健。
据文章描述,两人先问Claude哪一个挑战它最有把握,然后只给了一句非常简短的任务描述:计算平面N=4 SYM中九圈的六粒子(六边形)振幅。
此后的“科研指导”基本就是让它接着干。文中披露的一条典型指令大意是:我要去睡觉了,接下来几个小时不在,继续做,直到我叫停为止,每四到六小时汇报一次进度。
最终,Claude用两种方式各算了一遍:一是直接的自举法,二是Dixon团队那条经由形状因子的间接路线。据文章介绍,任选其一,终端用户的花费大约都在一两千美元,大头是长时间运行模型本身的费用。其中自举计算部分用Python和符号计算库SymPy完成,只占约100美元,相当于96个CPU跑一周。
von Hippel感慨,十年前他做这类研究时,96个CPU跑一周算是不小的投入,如今只要理由充分,这点资源相当平价。
验证者的感受:像一个塌掉的舒芙蕾
文章末尾附有Dixon亲自撰写的一段附言,题目就叫“被机器抢先是什么感觉”。
他写道,9月1日,Anthropic的两位研究者告诉他Claude算出了九圈振幅,并请他验证结果。对他而言,那一刻是大语言模型改变物理学这件事“真正落到自己身上”的时刻。
让Dixon印象深刻的,与其说是计算规模,不如说是整套流程的脆弱性。按他的描述,这套计算配方只要有任何一处出错,整个结果就会像失败的舒芙蕾一样塌掉,研究者只能回头苦苦排查。而且其中大量构造细节繁琐到不会被完整写进论文,这意味着Claude必须从零开始把所有代码搭建起来。
由于从九圈振幅倒推九圈形状因子相对容易,Dixon主要是沿这条路做的验证。这也带来一个略显微妙的局面:他花了两周验证的,正是自己团队已经追了好几年的目标。
他坦言并不感到沮丧,理由有两个。
他的团队本来就在用定制的Transformer模型预测更高圈数的结果,还提出过一句口号,大意是只要机器给出候选答案,他们就有全套工具去验证。
Claude解题时用的正是Dixon与合作者多年来发展出的方法,连结果的呈现格式都沿用了他们既有的规范。在他看来,他在验证Claude的同时,Claude也在验证他们过去所有的工作。这也是他那句“Claude比任何人都更懂我们的论文”的由来。
不过在称赞之余,Dixon也表示,在他看来,真正让人辗转反侧的时刻,会出现在模型抢在人类之前提出新的物理原理和洞见的时候。
中国团队几乎同时抵达
这个故事还有一条平行线索,且与中国有关。
在Anthropic联系von Hippel之后没几天,中国科学院理论物理研究所的何颂(Song He)也找上门来:他的课题组已经拿到了九圈结果的大部分。9月17日,何颂与Jirong Jing、Xiang Li在Zenodo上公开了一份数据集,题为《六胶子MHV振幅直至九圈的符号》,涵盖二圈至九圈的符号(symbol)数据。
https://zenodo.org/records/22800071
据von Hippel和Dixon的描述,何颂团队也借助了基于GPT-6的AI辅助,但只用于计算部分约束条件,整体框架仍由人来搭建,这与Anthropic那种“一句prompt加反复继续”的近乎全自动路线截然不同。
Dixon在附言里自嘲,两周之内他先后被“一台机器”以及“人类加机器”抢了先。
von Hippel特别提到,各方之间的氛围相当友好。接下来,Dixon、何颂及其合作者会发表这些结果,并为后来的研究者做详细解释和分析。
挑战者的复盘:低垂的果实比想象的多
回到von Hippel本人。他当初立下挑战,是想借自己熟悉的领域回答这个问题:AI到底能不能绕过那些人人都以为无法逾越的算力瓶颈?
他在挑战原文里的逻辑是这样的:外界都在争论AI能否产生真正的新想法,但想法有多难找,只有找到之后才知道;计算的难度则更“实在”。许多关于超级智能的末日设想,从模拟人类心智以操纵人心,到从第一性原理设计纳米机器,批评者的标准反驳都是算力不够。如果AI能用学术圈级别的资源解决一个被公认为算力受限的问题,那才真正值得担心。
结果呢?von Hippel的结论很坦诚:这次并没有出现他期待的那种“以意想不到的方式突破算力壁垒”。
Claude用的是已知方法,只是比人类此前愿意投入的算力多了一些。它可能受益于用Python而不是物理学家惯用的Maple或Mathematica,软件工程实践可能也比人类研究者更规范,但并没有到“超级智能”的程度。何颂团队几乎同步抵达,也从侧面说明这个目标对人类而言并非遥不可及。
他由此得出的最大体会是:哪怕目标简单明确,专家眼中遥不可及的事情,实际上可能并没有那么难,低垂的果实比预想的多。多年来一直有计算机背景的朋友对他说,振幅研究者只要多雇几个程序员就能大幅推进,von Hippel承认,这些人现在可以觉得自己说对了。
但他同样强调了另一面。这类计算琐碎而混乱,他自己如果用96个CPU跑一周,几乎必然会因为第一次出错而拖成两周。Claude Science却在几乎没有科学监督的情况下一次跑通,没有依赖任何外部合作者的输入。他给仍然认为AI错误百出、不堪大用的人的建议是:这类工作,它现在已经能可靠地完成了。
他还做了一个纵向对比。今年3月,Anthropic发布的“vibe physics”实验里,AI做物理项目还像个学生,任务规模小,需要大量手把手指导,错误频出。半年后,它完成的已是振幅领域顶尖专家才会去碰的前沿计算。他不排除这恰好是一个特别适合AI的问题,但他判断,技术本身确实变强了。
至于能否推而广之,von Hippel保持谨慎。N=4这类玩具模型通常只属于很小的研究圈子,而面向真实世界的振幅计算竞争激烈得多,那里的低垂果实可能更少。但他也提醒,做这些计算的研究者如果还没试过让AI科研平台一次性冲击前沿计算,就该试试了,同时要准备好验证结果的方案。他不会太意外,有人能在合理预算内再多挤出一圈。
写在最后
把这件事放回9月的背景里看,会更有意思。
就在本月8日,OpenAI宣布其未公开模型调动上万个AI智能体,给出了纳维-斯托克斯方程存在性与光滑性问题的一个反例,也就是千禧年大奖难题之一,该结果目前仍在接受数学界审视。与那种动用海量算力的“大兵团作战”相比,九圈振幅的故事显得朴素得多:一个商用科研平台,一句任务描述,几千美元,几天时间。
也正因为朴素,它可能更值得学术界关注。von Hippel最终坦承,他原本希望借这次挑战一窥未来,看到某种前所未见的计算新方法,从而在超级智能的争论中获得有依据的判断。但他得到的答案是,自己此前对极限在哪里的认识过于天真了。
而Dixon留下的那个问题仍然悬着:当大模型不再只是执行人类写好的配方,而是开始先于人类提出新的物理原理时,物理学家又该如何自处?
© THE END
本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:机器之心,36氪经授权发布。
2026年9月1日,英超曼联主场4比0大胜诺丁汉森林,拉什福德两射一传。九游娱乐从高位逼抢和边路突破两个维度复盘了曼联的统治性表现。
2026年9月8日,西甲巴萨客场3比1击败塞维利亚,莱万点射破门。九游娱乐关注了巴萨新援在防守端的融入情况,以及球队在控球率下降时的应对策略。
5条评论
李华
2026年9月11日 20:45
胜利属于准备更充分的一方!
王芳
2026年9月10日 10:00
每一个进球都值得反复回味。
赵丽
2026年9月9日 18:20
防守赢得冠军,进攻赢得球迷。
陈伟
2026年9月8日 22:15
团队配合才是取胜的关键。


张明
2026年9月12日 15:30
比赛不到最后一秒,永远不要放弃!