ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Claude取得理论物理突破,只用了一句话+几千美元

Claude取得理论物理突破,只用了一句话+几千美元 理论物理中一项保持了三年的计算纪录被 AI 刷新了。几个小时前Anthropic 宣布Claude 在科研平台 Claude Science 中基本无人监督地连续运行数天算出了平面 N4 超对称杨-米尔斯理论planar N4 super-Yang-Mills中的九圈六粒子散射振幅。这是理论物理「散射振幅」领域公认的前沿难题此前在该模型中的最高纪录停留在八圈由 SLAC 国家加速器实验室的 Lance Dixon 与合作者于 2023 年创下。这次突破由八圈纪录的创造者亲自把关。Dixon 独立验证了 Claude 的结果并评价称一个大语言模型能执行完这套复杂配方中的每一步、并把算力组织起来在他看来「是一场相当了不起的胜利」。他甚至直言除了他的合作者之外Claude 比任何人都更懂他们团队 2019 年和 2023 年的那两篇论文。更令人意外的是过程和成本。研究者交给 Claude 的只有一句任务描述此后的「指导」几乎只剩下「继续」整个计算折合到普通用户身上约一两千美元其中真正用于数值计算的部分只有约 100 美元相当于 96 个 CPU 跑一周。而 Dixon 原本认为直接计算九圈振幅太难他的团队为此已经筹备了好几年。这项突破的起点是一封公开的「战书」。8 月 7 日前理论物理学家、科普博主 Matt von Hippel 在自己的博客 4gravitons 上发了一篇带点挑衅意味的文章标题叫「只有 AI 进入我的领域才算数」。他在文中点名向 AI 公司下战书用一名学者能负担得起的算力去解决散射振幅领域的一个悬而未决的大问题。他给出了两个选项要么把 N8 超引力算到七圈要么把 N4 超对称杨-米尔斯理论的六粒子振幅算到九圈。一个月后AI 完成调整。Anthropic 刚刚刊出的正是 von Hippel 本人撰写的客座文章标题就是「是的Claude 能算九圈」。https://www.anthropic.com/research/yes-claude-can-do-nine-loops九圈难在哪里要理解这件事的分量得先说清楚物理学家在算什么。粒子物理学家预测粒子行为靠的是一类叫「散射振幅」的公式给定参与碰撞的粒子的能量和动量散射振幅能告诉你它们以某种方式发生反应的概率。预测算得越精确就越能和大型强子对撞机LHC这类实验的结果做细致比对。一旦出现偏差就可能是新物理的线索比如暗物质的本质或者宇宙中物质与反物质为何不对称。问题在于散射振幅极难精确计算物理学家几乎只能做近似。他们把计算按「圈」loop来分层圈数大致衡量了粒子之间的相互作用被允许复杂到什么程度。每多加一圈答案就更接近真实值但计算量也随之急剧膨胀。von Hippel 在挑战原文中写道这类计算的复杂度通常随圈数呈指数级甚至阶乘级增长。所以现实中绝大多数散射振幅只算到两圈少数能到三圈。粒子物理中最精确的那个预测电子反常磁矩用到了五圈。N4 超对称杨-米尔斯理论则是这个领域专门的玩具模型。「杨-米尔斯」是描述电磁力、强核力、弱核力这三种基本相互作用的理论框架「N4 超对称」则意味着每个粒子都配有四个超对称伙伴。粒子多到不现实这个理论并不描述真实世界。但恰恰是这种高度对称让许多变量组合相互抵消计算反而变得相对可控。研究者在这里打磨新方法看它们能走多远。这次用到的方法叫「自举」bootstrap。von Hippel 把它比作数独先写出答案可能的全部形式用一套专门的「字母表」记在计算机文件里然后拿所有已知约束去逐一排除包括其他方法给出的预测、答案必须遵守的规则、以及相关问题中已知的结果。理想情况下最后只剩一个候选能通过所有检查而且还有富余的检查条件用来确认没有算错。八圈的纪录Dixon 是绕着走拿到的。2023 年他和 Yu-Ting Liu 借助一种被称为「对跖对偶」antipodal duality的奇特对称性先算出相对更容易的「形状因子」form factor再由此换算出八圈振幅。此后几年他的团队一直盯着九圈计划沿用同样的间接路线。在他看来直接去算九圈振幅太难了。值得一提的是von Hippel 本人正是这一研究路线的老兵。他曾与 Dixon 等人合作把六粒子振幅推进到六圈和七圈。换句话说他挑的是自己亲手啃过的骨头。一句 prompt然后不断「继续」8 月底Anthropic 的两位物理学家 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 联系上了 von Hippel告诉他挑战已经被攻克。他们使用的是Fable 5.1模型运行在 Claude Science 平台上。von Hippel 在文中解释Claude Science 是一种「harness」即在大模型外面套上结构化规则和提示让它在科研任务中表现得更稳健。据文章描述两人先问 Claude 哪一个挑战它最有把握然后只给了一句非常简短的任务描述计算平面 N4 SYM 中九圈的六粒子六边形振幅。此后的「科研指导」基本就是让它接着干。文中披露的一条典型指令大意是我要去睡觉了接下来几个小时不在继续做直到我叫停为止每四到六小时汇报一次进度。最终Claude 用两种方式各算了一遍一是直接的自举法二是 Dixon 团队那条经由形状因子的间接路线。据文章介绍任选其一终端用户的花费大约都在一两千美元大头是长时间运行模型本身的费用。其中自举计算部分用 Python 和符号计算库 SymPy 完成只占约 100 美元相当于 96 个 CPU 跑一周。von Hippel 感慨十年前他做这类研究时96 个 CPU 跑一周算是不小的投入如今只要理由充分这点资源相当平价。验证者的感受像一个塌掉的舒芙蕾文章末尾附有 Dixon 亲自撰写的一段附言题目就叫「被机器抢先是什么感觉」。他写道9 月 1 日Anthropic 的两位研究者告诉他 Claude 算出了九圈振幅并请他验证结果。对他而言那一刻是大语言模型改变物理学这件事「真正落到自己身上」的时刻。让 Dixon 印象深刻的与其说是计算规模不如说是整套流程的脆弱性。按他的描述这套计算配方只要有任何一处出错整个结果就会像失败的舒芙蕾一样塌掉研究者只能回头苦苦排查。而且其中大量构造细节繁琐到不会被完整写进论文这意味着 Claude 必须从零开始把所有代码搭建起来。由于从九圈振幅倒推九圈形状因子相对容易Dixon 主要是沿这条路做的验证。这也带来一个略显微妙的局面他花了两周验证的正是自己团队已经追了好几年的目标。他坦言并不感到沮丧理由有两个。他的团队本来就在用定制的 Transformer 模型预测更高圈数的结果还提出过一句口号大意是只要机器给出候选答案他们就有全套工具去验证。Claude 解题时用的正是 Dixon 与合作者多年来发展出的方法连结果的呈现格式都沿用了他们既有的规范。在他看来他在验证 Claude 的同时Claude 也在验证他们过去所有的工作。这也是他那句「Claude 比任何人都更懂我们的论文」的由来。不过在称赞之余Dixon 也表示在他看来真正让人辗转反侧的时刻会出现在模型抢在人类之前提出新的物理原理和洞见的时候。中国团队几乎同时抵达这个故事还有一条平行线索且与中国有关。在 Anthropic 联系 von Hippel 之后没几天中国科学院理论物理研究所的何颂Song He也找上门来他的课题组已经拿到了九圈结果的大部分。9 月 17 日何颂与 Jirong Jing、Xiang Li 在 Zenodo 上公开了一份数据集题为《六胶子 MHV 振幅直至九圈的符号》涵盖二圈至九圈的符号symbol数据。https://zenodo.org/records/22800071据 von Hippel 和 Dixon 的描述何颂团队也借助了基于 GPT-6 的 AI 辅助但只用于计算部分约束条件整体框架仍由人来搭建这与 Anthropic 那种「一句 prompt 加反复继续」的近乎全自动路线截然不同。Dixon 在附言里自嘲两周之内他先后被「一台机器」以及「人类加机器」抢了先。von Hippel 特别提到各方之间的氛围相当友好。接下来Dixon、何颂及其合作者会发表这些结果并为后来的研究者做详细解释和分析。挑战者的复盘低垂的果实比想象的多回到 von Hippel 本人。他当初立下挑战是想借自己熟悉的领域回答这个问题AI 到底能不能绕过那些人人都以为无法逾越的算力瓶颈他在挑战原文里的逻辑是这样的外界都在争论 AI 能否产生真正的新想法但想法有多难找只有找到之后才知道计算的难度则更「实在」。许多关于超级智能的末日设想从模拟人类心智以操纵人心到从第一性原理设计纳米机器批评者的标准反驳都是算力不够。如果 AI 能用学术圈级别的资源解决一个被公认为算力受限的问题那才真正值得担心。结果呢von Hippel 的结论很坦诚这次并没有出现他期待的那种「以意想不到的方式突破算力壁垒」。Claude 用的是已知方法只是比人类此前愿意投入的算力多了一些。它可能受益于用 Python 而不是物理学家惯用的 Maple 或 Mathematica软件工程实践可能也比人类研究者更规范但并没有到「超级智能」的程度。何颂团队几乎同步抵达也从侧面说明这个目标对人类而言并非遥不可及。他由此得出的最大体会是哪怕目标简单明确专家眼中遥不可及的事情实际上可能并没有那么难低垂的果实比预想的多。 多年来一直有计算机背景的朋友对他说振幅研究者只要多雇几个程序员就能大幅推进von Hippel 承认这些人现在可以觉得自己说对了。但他同样强调了另一面。这类计算琐碎而混乱他自己如果用 96 个 CPU 跑一周几乎必然会因为第一次出错而拖成两周。Claude Science 却在几乎没有科学监督的情况下一次跑通没有依赖任何外部合作者的输入。他给仍然认为 AI 错误百出、不堪大用的人的建议是这类工作它现在已经能可靠地完成了。他还做了一个纵向对比。今年 3 月Anthropic 发布的「vibe physics」实验里AI 做物理项目还像个学生任务规模小需要大量手把手指导错误频出。半年后它完成的已是振幅领域顶尖专家才会去碰的前沿计算。他不排除这恰好是一个特别适合 AI 的问题但他判断技术本身确实变强了。至于能否推而广之von Hippel 保持谨慎。N4 这类玩具模型通常只属于很小的研究圈子而面向真实世界的振幅计算竞争激烈得多那里的低垂果实可能更少。但他也提醒做这些计算的研究者如果还没试过让 AI 科研平台一次性冲击前沿计算就该试试了同时要准备好验证结果的方案。他不会太意外有人能在合理预算内再多挤出一圈。写在最后把这件事放回 9 月的背景里看会更有意思。就在本月 8 日OpenAI 宣布其未公开模型调动上万个 AI 智能体给出了纳维-斯托克斯方程存在性与光滑性问题的一个反例也就是千禧年大奖难题之一该结果目前仍在接受数学界审视。与那种动用海量算力的「大兵团作战」相比九圈振幅的故事显得朴素得多一个商用科研平台一句任务描述几千美元几天时间。也正因为朴素它可能更值得学术界关注。von Hippel 最终坦承他原本希望借这次挑战一窥未来看到某种前所未见的计算新方法从而在超级智能的争论中获得有依据的判断。但他得到的答案是自己此前对极限在哪里的认识过于天真了。而 Dixon 留下的那个问题仍然悬着当大模型不再只是执行人类写好的配方而是开始先于人类提出新的物理原理时物理学家又该如何自处原文链接Claude取得理论物理突破只用了一句话几千美元-36氪我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink
返回列表