
1. 这件事到底发生了什么950个智能体跑21小时意味着什么先把事实摆清楚。Anthropic 让 950 个 AI 智能体agent在 DNA 数据库里连续跑了 21 个小时最后挖出一套此前没人见过的酶系统。消息里最抓人的不是找到新酶而是后半句——连 Anthropic 自己都说暂时还不知道这东西能干嘛。我第一反应不是哇好厉害而是这不就是典型的探索性计算发现吗。做过生物信息或者大规模检索的人应该都有同感真正难的从来不是跑出结果而是判断这个结果值不值得追。950 个智能体、21 小时这两个数字背后其实藏着一整套工程取舍值得拆开看。先说 950 这个量级。单个大模型跑数据库检索瓶颈不在算力而在注意力——它容易在长上下文里迷路检索到一半就开始编。多智能体并行的核心价值是把一个巨大的搜索空间切成很多小块每个智能体负责一块各自带着不同的假设去试。这跟人类科研团队分工是一个道理一个人盯一个方向比一个人盯一百个方向靠谱得多。再说 21 小时。这个时长说明任务不是查一下有没有而是反复迭代验证。DNA 数据库里序列数量是天文数字要在里面找没人见过的酶系统本质是在高维空间里做稀疏信号搜索。21 小时大概率包含了多轮提出假设—检索比对—排除—再提出的循环而不是一次性扫描。至于不知道有啥用这恰恰是最真实的部分。基础研究里大量发现都是先有结构、后有功能。CRISPR 当年被发现的时候也没人立刻想到它能做基因编辑。所以这条新闻真正的价值不在找到了什么而在于它验证了一条路径用大规模智能体协作去做开放式的科学探索是跑得通的。适合谁看这篇三类人。一是做 AI agent 工程化的想知道多智能体在真实长任务里怎么编排二是做计算生物、生信的想了解这套方法能不能迁移到自己的数据上三是纯粹对AI 做科研好奇的从业者想搞清楚这里面的水分和干货各占多少。2. 多智能体扫数据库的底层逻辑为什么不是一个大模型硬扛2.1 单模型为什么在长任务里会崩很多人第一反应是既然有大模型为什么不直接喂给它整个数据库让它找答案很简单也很残酷——上下文窗口再大也装不下一个 DNA 数据库而且模型在超长上下文里的检索精度会断崖式下跌。我做过类似的实验让单个模型在一个几万条的候选列表里找特定模式前 20% 它表现还行越往后越容易漏还会自信地编出不存在的条目。这不是模型笨是注意力机制本身的局限。序列越长每个 token 分到的注意力权重越被稀释关键信号就被淹没了。所以多智能体的第一个作用是分片。把数据库按物种、按序列长度、按功能域切成若干块每个智能体只负责一小块。这样每个智能体的上下文都是干净的检索精度能维持在高位。2.2 950 个智能体是怎么分工的这里我要基于常见的多智能体编排实践做合理推断因为 Anthropic 没公开细节。典型的科学探索型多智能体系统一般分这么几层角色探索者Explorer负责在分配到的数据分片里提出候选比如这段序列可能编码某种水解酶。验证者Verifier拿到候选后去交叉比对看它是不是已知序列的变体排除假阳性。批评者Critic专门挑刺质疑验证者的结论防止整个系统陷入集体幻觉。协调者Orchestrator汇总各分支结果决定下一轮往哪个方向深挖。950 这个数字很可能是探索者 验证者的并行实例总数再乘上多轮迭代。为什么需要这么多因为生物序列搜索的假阳性率极高你提出 1000 个候选可能 999 个都是已知蛋白的边角料。要靠数量堆出那 1 个真正新的东西。提示多智能体系统里验证者和批评者的角色比探索者更重要。探索者负责广撒网验证者负责收窄没有验证环节的多智能体就是一台批量生产幻觉的机器。2.3 21 小时的时间都花在哪了21 小时听起来长但拆开看很合理。假设 950 个智能体分 10 轮迭代每轮平均 2 小时出头。每轮里智能体要完成读取数据分片、生成候选、调用比对工具比如序列比对算法、交叉验证、写回结果。其中序列比对是最耗时的因为要跟已知数据库做全量比对这一步没法偷懒。真正省时间的地方在于并行。950 个智能体同时干活等于把原本需要串行几万小时的工作压缩到 21 小时。这就是多智能体的工程价值——不是让单个任务变快而是让可并行的探索整体吞吐量暴涨。3. 从标题到落地一套可参考的多智能体科研探索框架3.1 整体架构怎么搭如果你想把类似思路迁移到自己的领域不一定是 DNA也可以是专利检索、文献挖掘、材料筛选核心架构可以抽象成四层层级职责关键设计数据层存储和分片按维度切分保证每片可独立检索智能体层并行探索与验证角色分离探索/验证/批评各司其职编排层调度与迭代决定何时收敛、何时深挖评估层结果打分与去重防止重复劳动和幻觉累积这个架构的关键在于数据分片策略。分得好智能体之间互不干扰分得不好950 个智能体可能有一半在做重复工作。DNA 场景里按物种或按蛋白家族分片是常见做法因为同一家族的序列有相似性放在一起比对效率高。3.2 智能体的提示词怎么设计这是最容易被忽视、但最影响结果的部分。探索型智能体的提示词不能是帮我找新酶太模糊了。要拆成可执行的动作你的任务在给定的序列分片 [分片ID] 中寻找符合以下特征的候选 1. 包含 [某类功能域] 的保守motif 2. 与已知序列的相似度低于 [阈值] 3. 序列长度在 [范围] 内 输出格式候选ID、匹配motif、相似度分数、你的置信度0-1 如果找不到符合条件的候选明确输出无候选不要编造。注意最后那句不要编造。我实测下来不加这句模型在找不到的时候会硬凑编出看起来很像但根本不存在的序列特征。这是多智能体科研里最大的坑之一。验证型智能体的提示词则要反过来专门找茬你是验证者。针对以下候选 [候选信息]请 1. 检查它是否与已知数据库中的条目高度相似列出最相似的3条 2. 指出该候选可能是假阳性的理由 3. 给出你的验证结论通过 / 存疑 / 拒绝3.3 迭代收敛怎么控制21 小时跑完说明系统有明确的停止条件。常见的收敛策略有三种轮次上限跑满 N 轮就停简单粗暴但可控。新发现率阈值当某一轮的新候选数量低于阈值比如比上轮下降 80%说明已经挖得差不多了。置信度收敛当验证者对所有候选的结论都稳定不再出现存疑可以停。我倾向于组合使用轮次上限兜底新发现率做主判据。因为纯靠置信度容易过早停止模型有时候会集体自信明明还有东西没挖到就都说通过了。4. 实操中的关键细节与避坑经验4.1 数据预处理比智能体本身更重要很多人把精力全花在智能体编排上结果数据没洗干净跑出来的全是垃圾。DNA 数据库里充斥着重复序列、低质量测序片段、注释错误的条目。如果不在预处理阶段去掉这些950 个智能体会把大量时间浪费在已知的、错误的序列上。我的做法是三步清洗先去重相同序列只留一条再过滤低质量长度过短或含大量模糊碱基的丢掉最后统一注释格式。这三步做完数据量可能直接砍掉一半但检索质量会明显提升。4.2 假阳性是最大的敌人生物序列搜索里假阳性率高得吓人。一段随机序列跟已知蛋白比对经常也能撞出个 30% 的相似度。所以阈值设定极其关键。设太低满屏假阳性设太高真信号也被滤掉。实操中我会用双阈值策略先用宽松阈值比如相似度 25%捞一大批候选再用严格阈值比如 40%筛一遍。宽松阈值保证不漏严格阈值保证不滥。中间那批存疑的交给批评者智能体专门处理。4.3 智能体之间的通信开销950 个智能体如果两两通信消息量是 O(n²)直接爆炸。所以实际系统里一定是星型或分层结构智能体只跟协调者通信协调者汇总后再分发。这一点在搭建时就要设计好否则跑到一半消息队列就堵死了。注意多智能体系统里通信拓扑比单个智能体的能力更影响整体性能。扁平化通信在超过几十个智能体后基本不可用。4.4 结果去重和聚类950 个智能体并行跑必然产生大量重复候选。同一段序列可能被多个智能体在不同分片里都捞到。所以最后一定要做去重和聚类把相似的候选归并成一组再人工或自动评估。不做这一步你拿到的新发现列表里可能 90% 是同一个东西的不同表述。5. 常见问题排查速查表问题现象可能原因排查方向解决思路智能体大量输出无候选阈值过严或分片无有效数据检查分片数据量和阈值设置放宽阈值重新分片候选全是已知序列去重不彻底或数据库未更新核对已知库版本更新比对库加强去重跑了几小时没进展智能体陷入循环或通信阻塞看日志里是否有重复动作加轮次上限检查消息队列验证者全部通过批评机制失效集体幻觉抽查验证者结论引入独立批评者强制找茬结果无法复现随机性未固定或数据版本不一致检查随机种子和数据快照固定种子锁定数据版本这张表是我踩坑踩出来的。尤其是验证者全部通过这一条最隐蔽也最危险。当所有验证者都说通过的时候往往不是真的找到了好东西而是它们互相抄答案形成了回音室。解决办法是让批评者智能体独立于验证者用不同的提示词、甚至不同的模型来跑。6. 这套方法能迁移到哪些场景DNA 只是其中一个应用。这套大规模智能体并行探索 分层验证的框架本质上适用于任何搜索空间巨大、假阳性率高、需要多轮迭代的场景。专利检索就是一个典型。全球专利文献数量庞大要找出可能侵权但没被引用的专利跟找新酶的逻辑几乎一样分片、并行探索、交叉验证、去重聚类。我见过有团队用类似思路做专利辅助分析效率比人工高出一个数量级。材料筛选也一样。要找某种特定性能的新材料候选空间是元素组合的指数级爆炸。多智能体可以并行探索不同的组合方向验证者负责排除已知材料批评者负责质疑这个性能数据是不是算错了。甚至文献综述都能用。把某个领域的所有论文分片让智能体各自提取核心结论再汇总去重最后人工审核。这比一个人读几百篇论文快得多而且不容易漏。但要说清楚一点这套方法产出的是候选不是结论。Anthropic 说不知道有啥用恰恰是负责任的表现。智能体帮你把搜索空间从十亿缩小到一百但这一百个里哪个真有价值还得靠实验验证。把智能体的输出直接当真理是这套方法最大的误用。7. 我个人在实际操作中的几点体会跑过多智能体探索任务之后我最大的体会是别迷信数量。950 个智能体听起来震撼但如果分片策略烂、提示词模糊、验证机制缺失950 个和 9 个的区别只是更快地产生垃圾。真正决定成败的是架构设计不是智能体数量。第二个体会是收敛判断比探索本身难。什么时候该停什么时候该继续深挖这个决策做不好要么浪费算力要么错过发现。我的经验是设一个新发现率指标连续两轮下降超过 70% 就停比拍脑袋定轮次靠谱。第三人工审核环节不能省。智能体再强最后的判断还得人来下。Anthropic 那句不知道有啥用其实是在说机器负责发现人负责理解。这个分工在可预见的未来不会变。最后分享一个小技巧如果你要搭类似系统先用 10 个智能体跑一个小数据集把整个流程走通确认验证和去重环节没问题再扩展到几百个。直接上大规模出了问题你根本不知道是哪个环节崩的。我见过太多人一上来就堆智能体数量结果跑了一天拿到的结果连自己都不敢信。