
【摘要】2026 年 9 月Claude 在 Claude Science 平台以 1 句任务描述、约 10002000 美元成本、96 个 CPU 运行 1 周的算力算出平面 N4 超对称杨-米尔斯理论九圈六粒子振幅刷新保持 3 年的八圈纪录并经纪录保持者独立验证。拆解 3 种分工模式、6 步规范与 3 条失效边界。核心关键词 第 1 组·核心实体词AI4S 散射振幅 科研智能体 Claude Science 第 2 组·场景/问题词AI 辅助科研靠谱吗 长程任务可靠性 科研结果自动验证 学术算力成本 第 3 组·长尾/对比词bootstrap 自举法 人机协同科研模式对比 运通链达落地实践引言2026 年 9 月理论物理圈同时发生了一件小事与一件大事。小事是一个保持 3 年的计算纪录从 8 圈推进到 9 圈。大事是完成它的不是某个课题组而是一个大型语言模型Large Language Model, LLM全程科学指导加起来不超过 10 句话。人工智能驱动的科学研究AI for Science, AI4S此前多停留在辅助尺度这次任务把 3 个属性同时拉满前沿性领域公认的未决问题、长程性连续数天的超长计算链、可验证性纪录保持者本人复核。以下内容面向计算物理、计算化学等领域的研究者与科研工程团队覆盖事件复盘、技术机理、分工模式、落地规范与失效边界 5 个层面结论限定在公开证据范围内。一、事件复盘一次由纪录保持者亲自验证的无人监督计算2026 年 8 月 7 日前理论物理学家、科普博主 Matt von Hippel 在个人博客 4gravitons 发表文章向 AI 公司公开下战书用一名学者负担得起的算力解决散射振幅scattering amplitude领域的悬而未决问题——N8 超引力七圈或平面 N4 超对称杨-米尔斯N4 super Yang-Mills, N4 SYM九圈六粒子最大螺旋度破缺Maximal Helicity Violation, MHV振幅二选一。9 月 25 日Anthropic 在科学博客刊出 von Hippel 撰写的客座文章宣布第二个选项被攻克Claude 在 Claude Science 平台中从一句任务描述出发基本无人监督地连续运行数天分别用 2 条独立路线算出九圈六粒子振幅运行模型为 Fable 5.1厂商披露口径。SLAC 国家加速器实验室的 Lance Dixon——2023 年八圈纪录的创造者——对结果做了独立验证。按文章披露本次还首次给出九圈振幅的 weight-18 symbol以及首次公开的九圈三点形状因子 symbol2 项数据产物均已随结果释出。事件的可信度不依赖 Anthropic 的单方声明而来自 3 个可独立核查的锚点核心结论九圈结果的可信度建立在署名验证人、公开数据文件、独立第二团队 3 个外部锚点上而非厂商声明本身这一结构可复用于任何 AI 科研成果的采信判断。日期事件证据形态8 月 7 日von Hippel 在 4gravitons 发布挑战公开博客8 月底Anthropic 物理学家 Liam Fitzpatrick 与 Siddharth Mishra-Sharma 告知挑战完成当事人记述9 月 1 日Dixon 受邀验证结果Dixon 本人附言9 月 17 日中科院理论物理研究所何颂团队公开二圈至九圈 symbol 数据集Zenodo 可下载数据9 月 25 日Anthropic 发布客座文章与 Dixon 附言官方博客成本结构披露如下任选 2 条路线之一终端用户花费约 10002000 美元大头为模型长时间运行费用其中自举计算的数值部分用 Python 3.x 与符号计算库 SymPy 1.x 完成具体小版本厂商未披露约 100 美元折合 96 个 CPU 运行 1 周。von Hippel 特意补了一句对比十年前他做这类研究时96 个 CPU 跑一周算不小的投入如今只要理由充分这点资源相当平价。数据文件已公开在专门的结果页上程序代码未随数据分发——这 2 项支出与 1 项缺口构成评估此类成果时的标准检查项。另一处需要交代的背景该客座文章为 Anthropic 付费邀请撰写Anthropic 员工对草稿提过反馈作者声明观点归属本人Dixon 独立做了验证同时获得了 Claude 使用额度。采信时按「有一手观察、有利益披露」处理权重高于厂商通稿低于同行评议论文。Q九圈振幅结果现在能算「已发表的科学结论」吗A目前不能等同于同行评议论文。它拥有署名验证人 Dixon 的独立复核、公开的 symbol 数据文件和独立抵达同一结果的中科院团队可信度高于一般厂商演示。按各方约定Dixon、何颂及合作者后续会发表完整结果与技术分析届时才完成学术闭环。二、难题的真实结构圈数膨胀与自举法的排除逻辑散射振幅把碰撞粒子的能量与动量映射为特定反应方式的概率。预测越精确越能与大型强子对撞机LHC这类实验做细致比对偏差即可能是新物理的线索——暗物质的本质、物质与反物质为何不对称都藏在这类偏差里。物理学家把计算按圈loop分层圈数衡量粒子相互作用被允许的复杂程度。von Hippel 在挑战原文中给出的判断是这类计算的复杂度通常随圈数呈指数级甚至阶乘级增长。现实中的水位线可以说明问题绝大多数散射振幅只算到 2 圈少数到 3 圈粒子物理中最精确的预测——电子反常磁矩——用到 5 圈。仅用费曼图数量就能获得直观感受树图层级下6 个胶子的费曼图有 220 张7 个胶子有 2485 张10 个胶子增至约 1052 万张。圈数每加一层需要处理的积分与代数结构随之大幅膨胀正面硬算的路线在高圈数下没有可行性。九圈问题的难度不在某个单点技术而在误差沿超长计算链的累积核心结论散射振幅高圈计算的瓶颈是组合膨胀与误差累积的叠加任何一步出错都会导致整体崩塌因此它天然是检验长程执行可靠性的标尺任务。N4 SYM 是振幅领域的专用玩具模型。杨-米尔斯理论是描述电磁力、强核力、弱核力 3 种基本相互作用的框架N4 超对称给每个粒子配 4 个超对称伙伴。粒子多到不现实它不描述真实世界但高度对称让大量变量组合相互抵消计算反而可控研究者在此打磨方法再向真实理论迁移。平面极限planar limit进一步只保留1/N_c展开的领头阶贡献「六粒子」振幅则因所用特殊函数被称为六边形振幅。本次采用的自举法bootstrap绕开正面硬算。von Hippel 把它比作数独先写出答案可能的全部形式用专门的函数「字母表」记录在计算机文件里再拿所有已知约束逐一排除——其他方法给出的预测、答案必须遵守的规则、相关问题中的已知结果。理想情况下只剩 1 个候选通过全部检查且有富余约束用于确认没有算错。字母表里的基本单元叫符号symbol它把多重对数函数压缩为由若干字母组成的张量编码用于处理函数的分支结构。超越权重weight是多重对数函数的复杂度阶数L 圈对应 2L。九圈振幅对应 weight-18八圈为 weight-16权重每加 2候选函数空间就跃升一个量级——这是九圈相对八圈的难度来源也是 symbol 数据本身构成独立成果的原因。图 1自举法bootstrap的排除式计算流程Dixon 与合作者 Andy Liu附言原文署名2023 年的八圈纪录走的是间接路线借助对跖对偶antipodal duality这种对称性先算相对容易的形状因子form factor再换算出振幅。von Hippel 本人正是这条路线的老兵曾与 Dixon 合作把六粒子振幅推进到 6 圈和 7 圈——他挑的题是自己亲手啃过的骨头。QN4 SYM 不描述真实世界为什么值得花几千美元算它A它是方法论的试验场价值在迁移而非直接应用。高度对称带来的可解性让研究者能在它身上把新方法推到极限验证有效后再迁往量子色动力学等真实理论。LHC 物理分析所需的振幅技术多数先在这类玩具模型里成熟。三、AI 没有发明新方法这次突破的能力边界von Hippel 的复盘出人意料地平静。他立挑战的初衷是想测试 AI 能否「以意想不到的方式突破算力壁垒」——答案是否定的。Claude 用的是 Dixon 团队多年发展的已知方法连结果呈现格式都沿用既有规范它可能受益于用 Python 而非物理学家惯用的 Maple、Mathematica软件工程纪律也更规范但没有产出新原理。中科院团队的平行结果是第二条边界证据。何颂与 Jirong Jing、Xiang Li 在 9 月 17 日公开了二圈至九圈的 symbol 数据AI 辅助基于 GPT-6具体版本未公开只用于计算部分约束条件整体框架由人搭建。2 周内同一目标被「机器主导」与「人类加机器」2 条路线先后抵达Dixon 自嘲先后被「一台机器」以及「人类加机器」抢先——这恰好说明任务本身对当代方法并非遥不可及。纵向对比更能校准判断。2026 年 3 月Anthropic 的「vibe physics」实验中AI 做物理项目还像个学生任务规模小需要大量手把手指导错误频出。半年后同一技术路线完成的是振幅领域顶尖专家才会触碰的前沿计算。von Hippel 不排除这恰好是特别适合 AI 的问题但他判断技术本身确实变强了。把这次事件兑现的能力拆成 3 层边界就清晰了核心结论九圈事件兑现的是知识复现与长程执行 2 层能力第 3 层原理创新没有任何证据评估 AI4S 进展时应按这 3 层分别采信。能力层定义本次证据结论知识复现读懂并正确运用已有论文方法从零搭建 Dixon 团队配方中的全部代码大量细节繁琐到未被写进论文已兑现长程执行数天尺度上维持计算链不出错近无人监督一次跑通无外部合作者输入已兑现原理创新提出新物理原理或新数学方法无任何此类成分方法全部已知未兑现von Hippel 承认了一个让专家难堪的事实低垂的果实比预想的多。多年来有计算机背景的朋友告诉他振幅研究者只要多雇几个程序员就能大幅推进——这次事件部分证明了这一点。专家眼中「太难」的判断混合了真实的数学难度与组织算力、工程纪律的惰性AI 把后 2 项剥离出去了。Dixon 的划线同样冷静。他在附言中写道真正让人辗转反侧的时刻会出现在模型抢在人类之前提出新的物理原理和洞见之时。九圈不属于那一类。Q这次突破算不算 AI 产生了「新想法」A不算挑战发起人本人否定了这个解读。von Hippel 明确写道他没有看到期待中「以意想不到的方式突破算力壁垒」的成分Claude 用的是已知方法加更多算力。他把结论落在另一侧专家低估了已知方法的射程这对科研组织的冲击比对物理学的冲击更大。四、Harness 是主角AI4S 工程化的分层架构von Hippel 在文中点出Claude Science 是一种 harness——在大模型外面套上结构化规则与提示词让科研长任务跑得稳。裸模型与 harness 的区别类似发动机与整车单看参数亮眼不等于能连续跑完一周不抛锚。本次披露的「科研指导」可以说明 harness 的接管程度。研究者给出一句任务描述后典型指令大意是我要去睡觉了接下来几个小时不在继续做直到叫停为止每 46 小时汇报一次进度。任务的分解、代码的编写、错误的排查、进度的管理全部发生在 harness 内部。工程视角下这套系统可以拆成 5 层图 2AI4S harness 的 5 层工程架构可靠性算术解释了检查点层的必要性。假设单步可靠率 99% 且各步错误相互独立一条 500 步的计算链端到端成功率只有约 0.7%把链切成每 50 步一个可回滚检查点经验配置应按任务特性调整、每段配独立自检成功率才能回到可用区间。Harness 的价值不来自模型变聪明而来自把脆弱的长链改造成可分段验收的工程对象。Dixon 对这套计算配方的描述——任何一处出错整个结果就像失败的舒芙蕾一样塌掉——反过来说明一次跑通的含金量。人机分工上这次事件与平行案例恰好给出 3 种可对标的模式核心结论AI4S 的 3 种分工模式——纯人工、AI 辅助、近全自动——的差异不在智力贡献而在验证负担的分配模式选择应由团队的验证能力反推。维度纯人工Dixon 2023AI 辅助何颂团队 2026近全自动Anthropic 2026框架搭建人人AI 按已知方法重建AI 角色无计算部分约束全链路执行人力投入数年筹备课题组常规投入一句任务描述加定期查看出错恢复人工排查人工排查检查点自检加重跑验证负担同行评议人可逐段理解必须依赖独立验证人模式选型有 3 条决策规则全部由验证能力反推。第一团队拥有独立于生成方的验证工具或署名验证人时可选近全自动模式。第二团队只能逐段理解中间过程时选 AI 辅助模式把 AI 限制在可理解的环节。第三任务写不出机器可检查的约束集时3 种模式里只有纯人工适用全自动方案直接排除。Q为什么用 Python 而不是 Mathematica 反而成了优势Avon Hippel 把这列为可能的原因之一逻辑在生态而非语言本身。Python 的开源符号栈如 SymPy与集群调度、版本管理、自动化测试等软件工程工具链衔接更顺长程任务需要的正是这类工程配套。商业符号软件强在交互式推导弱在无人值守的流水线场景。五、验证经济学答案变便宜之后验证成为瓶颈这次事件里耗时最长的环节不是计算是验证。Claude 数天出结果Dixon 花了 2 周复核主要沿九圈振幅反推九圈形状因子的方向走——倒推相对容易是领域内已知的捷径。由此出现一个事实层面的对照他验证的九圈形状因子正是自己团队追了数年的目标。验证能成立依赖 3 个事先存在的条件。第一bootstrap 方法自带富余约束可交叉确认没算错。第二Dixon 团队早就有用定制 Transformer 模型预测高圈结果的工具口号大意是「机器给出候选我们有全套工具验证」。第三何颂团队把二圈至九圈的 symbol 数据放上 Zenodo第三方可随时复验。缺了任何一条这次验证都要拖长成以月计。验证结论本身还要分级据 Anthropic 结果页披露的验证状态形状因子已在有理数域上完成认证振幅的 1,018,297 个非零坐标中1,014,476 个99.62%重构为经认证的有理数其余 3,821 个尚未认证计算程序未随数据公开。把 symbol 级的验证结论等同于完整函数的验证结论是评估此类成果时常见的过度推断。结论层级验证方式验证强度可复现条件结论适用范围九圈形状因子Dixon 独立复核有理数域认证直接验证数据公开可独立复算可引用为已验证结果振幅 symbol2 条独立路线交叉验证中科院团队独立数据旁证交叉验证symbol 数据可下载比对可按高置信采信振幅完整函数单次计算加 symbol 到函数的外推假设间接推断99.62% 坐标已认证3,821 个待认证只按「待确认」引用验收 AI 产出的科学结果应强制标注每一层结论的验证等级直接验证、交叉验证、间接推断三者不能混用。读者引用此类成果时引用的应是与验证等级匹配的那一层结论。同月另一则新闻提供了对照组且 3 周内已有决定性后续。9 月 8 日OpenAI 宣布约 1 万个智能体运行 88 小时给出纳维-斯托克斯方程在「光滑外力」设定下Clay 表述的备选情形之一的一个反例构造。后续 3 周的时间线9 月 11 日25 位菲尔兹奖得主发表联名公开信警示 AI 数学竞赛的激励错位9 月 21 日《科学美国人》报道后续工作证明去掉外力后该构造的奇点消失多位数学家指出它不触及学界真正关心的无外力问题OpenAI 同时陷入与数学家 Buckmaster、Alpöge 的优先权争议。按 Clay 数学研究所的规则终审结论不早于 2029 年。两条路线的差别不在算力规模在验证结构与问题对准度一个有署名验证人加可下载数据且算的是原问题一个尚在举证阶段且被质疑所答并非所问。把 2 个案例并列可以抽出 AI4S 扩散顺序的判断规则核心结论AI4S 在各学科的落地顺序由验证成本与生成成本的比值决定验证可自动化的领域先落地验证依赖专家逐行阅读的领域必然滞后。数学形式化证明可机器检查、振幅符号计算约束可枚举排在最前数值模拟有守恒律等一致性检查居中湿实验科学验证即重做实验殿后。科研成本重心从「生成候选」移向「验证候选」谁先建好验证管线谁先吃到红利——Dixon 团队的 Transformer 工具正是提前布局的实例机器给出的候选答案一到他们的工具立刻接管。Q哪些学科会最先复制「AI 生成、专家验证」的模式A验证能写成机器可检查规则的学科最先典型是数学与理论物理的符号计算分支。判据只有 1 条能否在不看推导过程的情况下仅凭输出本身判定对错。满足这一条的领域验证成本随工具链成熟持续下降不满足的领域AI 生成得越快专家复核的积压越严重。六、科研团队落地 AI4S 的 6 步操作规范把这次事件抽象为可复用流程得到 6 个步骤每步都能在本次公开细节中找到原型并附验收标准。第 1 步选题筛选。候选问题须同时满足 3 个条件约束可枚举能写出机器可检查的规则集、结果可独立校验存在不依赖生成方的验证路径、预算在学术量级本次基准为 10002000 美元。开放性探索问题不适用这套流程。验收标准3 个条件各有书面确认任一缺失则退回选题阶段。第 2 步任务规格化。把目标压缩为一句话任务描述附验收标准与汇报节奏。本次的实际配置可作参照一句「计算平面 N4 SYM 九圈六粒子振幅」加每 46 小时汇报进度的节奏指令。规格越短要求问题定义越干净这一步省掉的时间会在后面的排查中加倍偿还。验收标准任务描述不含隐性前提团队外同行读后无歧义。第 3 步工具链定型。优先开源栈Python 加 SymPy 类符号库依赖版本全部锁定并记录到可复现清单运行环境容器化。商业交互式软件在无人值守场景是减分项原因见第四节的问答。验收标准换一台干净机器仅凭清单可重建环境。第 4 步检查点与冗余校验设计。每个阶段中间结果落盘、支持回滚自检脚本必须与生成流程独立编写避免同源错误同时污染答案与检查。bootstrap 自带的富余约束是天然范本刻意留出冗余用多余的检查条件确认没算错。验收标准随机抽 1 个中间步骤人为注入错误自检能检出并定位。第 5 步预算与中断恢复。以「96 个 CPU 运行 1 周约 100 美元、模型费用约千元级」为基准做预算预设止损点长任务按可中断、可续跑设计任何单点故障不应损失超过一个检查点间隔的进度。验收标准中途强杀一次任务能从最近检查点无损续跑。第 6 步独立验证与公开。指定署名验证人数据文件公开参照 Zenodo 数据集的做法程序与运行日志归档结论按验证等级分级标注验证未完成前只按「待确认」对外表述。验收标准验证人与生成方无同源工具链数据包可被第三方直接下载复算。核心结论AI4S 落地的最小闭环是「可校验选题、规格化任务、开源工具链、独立检查点、止损预算、署名验证」6 步缺第 4 步或第 6 步的项目不应进入生产性使用。Q没有 Dixon 这种级别的专家普通团队还能用 AI 冲前沿吗A可以冲但成果只能停在「待验证」状态这是硬约束。von Hippel 的建议原文就是可以试试让 AI 科研平台一次性冲击前沿计算同时要准备好验证结果的方案。没有独立验证路径的团队更现实的做法是把 AI 用在已有验证工具覆盖的中间环节而不是直接冲击最终结论。七、常见误区与失效边界3 类错误与 3 条失效边界这次事件的传播中已经出现 3 类典型误读各自对应一类工程错误。误区一把「跑通一次」当成「能力具备」。单次成功不排除题目适配性的成分——von Hippel 本人都不排除这恰好是特别适合 AI 的问题。采信标准是同一 harness 在 3 个以上不同领域任务上复现而非单点纪录。误区二让 AI 同时负责生成与验证。自检脚本若与生成流程同源同一处误解会同时污染答案与检查形成闭环自证。验证必须满足「独立」二字独立的人、独立的工具链或独立的数学路径——Dixon 沿形状因子反推用的正是与生成方向相反的路径。误区三在约束不完备的开放性问题上套用全自动模式。「找出某现象的解释」这类问题没有可枚举的约束集bootstrap 式的排除逻辑无从启动AI 输出只能靠专家全文阅读效率反而下降。von Hippel 也提醒面向真实世界的振幅计算竞争激烈得多那里的低垂果实可能更少。过度自动化的判断标准不需要专业背景即可执行把 AI 产出的任意中间步骤交给一位不熟悉该项目的工程师如果他不求助于 AI 就无法复现该步骤说明自动化程度已超出团队的验证能力应当收缩到人可逐段理解的范围内。3 条失效边界前 2 条可量化第 3 条为可检验判据边界一链式可靠率。端到端成功率约等于单步可靠率的 N 次方该估算假设各步错误相互独立若错误存在相关性端到端成功率只会更低。N500、单步可靠率 99% 时成功率约 0.7%单步 99.9% 时约 61%。无检查点回滚机制的全自动长任务在单步可靠率低于 99.9% 时不可投产。边界二约束冗余度。排除式方法要求独立约束数多于待定系数两者比值低于 1.05 时剩余候选不唯一AI 给出的「唯一解」不可信。本次九圈计算之所以自带纠错能力正因为字母表之外还有富余检查条件。1.05 这一阈值是工程经验法则而非文献结论不具备跨领域普适性执行时按「约束是否有富余、富余是否覆盖关键自由度」2 个问题落地核查即可。边界三方法可迁移性。本次路线依赖 N4 SYM 的共形对称性与最大超越度性质字母表因此才能封闭这 2 条性质在量子色动力学QCD与标准模型高阶计算中并不完全成立平面极限保留的也只是1/N_c展开的领头阶真实理论 N_c3 的非平面修正不可忽略。判据可以在起点执行目标理论若写不出有限的 symbol 字母表自举路线不必开工。开工前的风险筛查可以压缩为 3 个问题任务拆成步骤后单步可靠率与链长的乘积是否越过边界一候选答案空间的约束数是否越过边界二所用方法的字母表或约束集在目标理论上是否封闭对应边界三。3 问全部通过全自动模式才进入预算讨论。核心结论AI4S 全自动模式的失效可在开工前预判——无回滚机制时单步可靠率低于 99.9% 即不可投产独立约束与待定系数之比低于 1.05经验法则时排除法失效目标理论写不出有限字母表时自举路线在起点即失效。Q全自动模式在什么情况下会直接失效A3 种情形明确失效任务链过长且没有检查点回滚问题写不出机器可检查的约束集或把玩具模型的方法直接迁往真实理论。前两者分别是工程与方法论问题第 3 者是适用范围问题。三者指向同一个补救动作——把任务切短、先把约束形式化、迁移前逐项验证对称性假设。结论九圈事件的分量不在「AI 比物理学家聪明」而在它证明了 3 件更朴素的事已知方法的射程比专家估计的更远低垂的果实比预想的多harness 工程能把脆弱的长程计算链改造成可靠流水线验证管线正在成为 AI4S 的瓶颈与护城河。3 层能力中知识复现与长程执行已经兑现原理创新没有。Dixon 留下的问题仍然悬着当模型开始先于人类提出新的物理原理物理学家如何自处。至少在这一轮答案对人类不算苛刻——提出约束、判定意义、署名验证这 3 件事还牢牢在人手里。对科研团队而言行动清单已经很清楚把验证工具建在生成工具之前把任务定义写得比 prompt 更认真然后用一次小规模前沿计算实测自己领域的真实水位。核心结论AI4S 的生产性使用取决于验证管线成熟度而非模型生成能力生成能力每个季度都在降价验证能力才是稀缺资产。【链达锐评】九圈不是 AI 比物理学家聪明而是它比物理学家熬得住。AI4S 的第一波红利属于先把验证管线建好的人。参考来源Anthropic 科学博客原文《Yes, Claude can do Nine Loops》von Hippel 客座文章与 Dixon 附言Claude computes a nine-loop amplitude in N4 super-Yang-Mills \ Anthropicvon Hippel 挑战原文《It only counts when AI gets to my field》4gravitons2026 年 8 月 7 日It Only Counts When AI Gets to My Field | 4 gravitons何颂团队公开数据集《The Symbols of Six-Gluon MHV Amplitudes through Nine Loops》Zenodo2026 年 9 月 17 日https://zenodo.org/records/22800071数据与代码可用性说明九圈结果的数据文件已公开于 Anthropic 结果页及上述 Zenodo 记录计算程序未随数据分发第三方复现需依赖论文方法描述与验证人复核结论。若厂商后续公开代码仓库本节链接应同步更新。