
Anthropic自己的实验室挖出了一个类CRISPR新系统——这则消息最先不是从官网公告里看到的而是在几个生信和基因编辑讨论群里传开的。和那种“AI又发布了一个新模型”的官宣完全不同这次更像一份提前泄露的实验记录没有炫目的Demo没有API价格表却让做基因编辑的人、做宏基因组数据挖掘的人、做合成生物学的朋友都同时抬了一下头。原因很简单CRISPR过去十几年是生物技术最热闹的赛道但真正能用的“新酶”依然稀缺。如果Anthropic真的靠内部实验室从海量基因组序列里捞出一个机制上游全新的核酸酶那它就不是给AI圈子出的题而是给整个基因编辑工具箱填的一件新武器。这篇文章就围绕这件事把“类CRISPR”是什么、这类系统一般怎么被挖出来、如果消息属实意味着什么以及目前阶段该怎么看完整拆一遍。1. 一个AI模型公司为什么突然跟“基因剪刀”扯上了关系1.1 Anthropic的实验室动作其实早有信号先说结论AI公司下场做生物研究已经不是跨界而是趋势。AlphaFold系列把蛋白质结构预测从“月级”变成“分钟级”之后蛋白质语言模型、结构生成模型也跟着起来了AI在蛋白质设计、酶改造、基因编辑工具开发这些方向上连续出现了好几篇让人没法忽视的工作。Anthropic作为头部模型公司过去被讨论得最多的是大模型安全和推理能力但它的公开信号并不少。创始人Dario Amodei在公开文章里反复表达过一个观点生物学是AI能带来巨大正面影响的领域之一AI的最大价值不只是写代码更在于帮助科学家理解生命系统的复杂度。顺着这个方向Anthropic内部组建了面向生物安全的团队做过关于AI加速病毒研究的风险评估也在公开招聘页面里出现过生物工程师、计算生物学研究员、蛋白质设计相关岗位。这些动作单看都不算大但放在一起就是“实验室正在认真搞生物”的痕迹。所以这次传出“Anthropic自己的实验室挖出了一个类CRISPR新系统”我在群里的第一反应不是惊讶而是“终于等到这一步了”。AI公司做新酶发现技术路径上完全通一边是语言模型擅长在大规模序列数据里找规律一边是基因编辑领域正好缺新蛋白两边一拍即合。1.2 基因编辑行业恰恰缺“新酶”AI公司正好补位过去十几年基因编辑工具的主流还是那几个名字Cas9、Cas12、Cas13。每个工具都有经典场景但也都有明确的短板。Cas9是目前最普及的DNA剪刀成熟度高、应用生态完善但蛋白个头大SpyCas9大约1368个氨基酸做体内治疗时不好装进病毒载体Cas12a体积小一些偏好T-rich的PAM序列适合某些AT含量高的基因组但可用的PAM选择依然有限Cas13转向了RNA靶向做核酸检测很好但真正要解决通用问题它的切割特性和递送方式也还有不少坑。更关键的是自然界里的真实多样性远没有被挖干净。大多数针对环境样本的测序项目拿到数据之后只做物种注释和功能基因统计很少专门去搜索“第X类新的RNA引导核酸酶”。而这些数据里恰恰藏着大量Cas9/Cas12祖先、远亲、平行演化的未知系统。谁能更高效地把它们捞出来谁就有机会定义下一代编辑工具的基础专利。AI公司进入这个赛道最大的优势是算法能力。传统团队通常用BLAST或HMMER做远程同源搜索靠人工经验判定候选基因好不好而语言模型可以把所有蛋白质序列放进一个高维语义空间直接搜索“结构和功能意义相近、但序列差异极大”的远亲蛋白然后快速用结构预测给每个候选打分。这种干湿结合的“AI找酶”模式和Anthropic这类公司的技术栈几乎完美匹配。2. “类CRISPR”不是碰瓷先搞清CRISPR工具箱里的门道2.1 CRISPR为什么是“可编程的”这套机制到底怎么运转要理解“类CRISPR”得先把CRISPR本身怎么工作讲透。我在给朋友科普时最喜欢用这个类比CRISPR系统等于“GPS导航剪刀”。GPS导航是那条guide RNA它上面有一段和目标DNA互补的序列负责带路剪刀是Cas蛋白负责在指定位置切断DNA双链。两者绑定在一起只要改guide RNA的序列剪刀就会被带到新的位置这就是大家常说的“可编程”。导航里还有一个关键校验点叫PAM。PAM是目标DNA上靠近剪切口的一小段保守序列Cas蛋白在切割前必须先确认PAM存在才肯发动。这相当于GPS导航除了认路还要检查“停车位”是否合法。PAM规则决定了这个工具能在基因组哪些位置“停车”PAM越宽松、越多样工具的适用范围就越广。之所以有这么多Cas9、Cas12、Cas13变体核心原因就是每个系统都有自己的PAM偏好、切割形式和体积大小。一个系统的PAM太严格就意味着它在基因组上能找到的靶点变少。对新工具的需求本质上是“更多、更小、更好用的剪刀型号”。2.2 类CRISPR家族巡礼从IscB到Fanzor“类CRISPR”这个词严格来说不是PubMed里收录的标准分类名但在行业里大家用它泛指一类结构上和CRISPR-Cas系统相似但并非细菌经典CRISPR免疫系统的RNA引导核酸酶。它们大部分编码在转座子或移动遗传元件里靠RNA引导执行DNA切割功能上和CRISPR很像但进化来源完全不同。我把常见系统整理成了下面这张表方便对照理解这类工具之间的差异系统名称大小氨基酸靶标主要特征Cas9SpyCas9约1368DNA双链经典编辑器双RNA引导PAM为NGG平末端切割Cas12a约1200DNA双链单crRNA引导PAM偏好T产生粘性末端Cas13约1100RNA单链靶向RNA切割RNA碰撞后可非特异切割旁路RNAIscB约400-500DNA双链被认为是Cas9的祖先体积小编码于IS200/IS605转座子TnpB约400DNA双链被认为与Cas12有进化关联存在于转座子需要ωRNA引导Fanzor约500-700DNA双链真核生物里的OMEGA类系统比细菌Cas更“轻量”IscB和TnpB是过去几年最受关注的“类CRISPR”明星。IscB几乎可以看成“小型化Cas9”体积不到Cas9一半但同样能在RNA引导下切断DNATnpB则被认为和Cas12共用同一个进化祖先。张锋团队把这堆来自转座子的RNA引导核酸酶统称为OMEGA系统全称很有意思叫“Obligate Mobile Element Guided Activity”——直译过来就是“移动遗传元件必然携带的RNA引导活性”。Fanzor则是从真菌、藻类、原生生物里翻出来的真核版本比细菌来源的Cas蛋白多了一层“真核细胞里工作”的潜力天然更适合做动物和植物的基因编辑。如果一个新系统被描述为“类CRISPR”最合理的推测就是它落在这个大家族里的某个新分支上。2.3 一个新系统要称得上“新”通常要过哪几道关在AI圈“新模型”的判定标准是benchmark分数在基因编辑圈“新系统”的门槛高得多。一个候选蛋白要撑起“类CRISPR新系统”这个称号至少要过四道关。第一关是序列新。它的序列不能跟已知Cas蛋白高度相似至少主序列同一度要显著低于Cas9和Cas12这种“近亲”否则只能说是一个新变体不能说是新系统。第二关是机制可编程。实验者必须能看到它依赖一条可设计的RNA来引导切割。只靠蛋白本身乱切那不叫基因编辑工具那叫棒状核酸酶。第三关是靶向规则清晰。新系统得有明确的PAM偏好或PFS偏好没有这个规则研究者就没法预测它能编辑哪里也就没法实际使用。第四关是要能在异源宿主里工作。很多微生物来源的蛋白在原宿主里活性很高一转到人类细胞或植物细胞里就失活最常见的原因是表达量上不去、导向RNA不被正确加工、或者蛋白在真核环境里折叠异常。能发表论文的系统通常都得拿出至少一个真核细胞里的编辑数据。如果消息属实Anthropic实验室那个“新系统”至少已经走过了前两关至于走到第几步还是要看后续的实验数据。3. 从海量基因组里“挖”出一个新系统大致要经历什么3.1 找矿基因组数据库不是越大越好先要“洗数据”挖新酶的第一步跟挖矿很像先把“矿区”圈出来。“矿区”就是公共基因组数据库NCBI、EMBL、JGI、MGnify这些地方聚集了几万个完整基因组和上亿条宏基因组组装序列尤其近年大量来自肠道、土壤、海洋、热泉的未培养微生物数据被拼了出来里面藏着整个人类还没见识过的蛋白空间。但数据库大不等于好挖。直接拉全库跑搜索是一个非常糟糕的做法因为公共库里质量参差不齐。比较稳妥的流程是先用QC工具过滤低质量组装、剔除质粒和噬菌体污染的片段、去掉冗余重复序列再把同一物种的多个基因组合并去重。实战中还有一个关键习惯把已知的转座酶库比如ISfinder单独拿出来做一轮反向过滤。因为很多类CRISPR候选基因其实是从转座子上预测出来的如果不去掉已知转座酶你会莫名奇妙得到一大堆和Cas毫无关系的假阳性。做完清洗剩下的蛋白质序列集才有资格进入搜索阶段。这里的核心是老生常谈但总被忽略的道理挖矿不是比谁数据多而是比谁筛选逻辑好。3.2 筛矿远程同源搜索是第一步AI模型在这里当辅助有了候选蛋白集接下来要做远程同源搜索。传统Cas蛋白之间序列差异极大用普通BLAST很难捞出远亲所以一般要用HMMER或HHpred这类基于隐马尔可夫模型的工具构建已知Cas蛋白家族的profile再对整个候选库跑一遍。典型命令大概是这样hmmsearch --cut_tc --domtblout candidate.domtblout /path/to/Cas_RuvC.hmm /path/to/all_proteins.faa candidate.hmmsearch这里的核心是选择结构域。Cas9、Cas12这类蛋白都含有一个叫RuvC的核酸酶结构域就像所有“剪刀”共享的一个公共模块。只要针对RuvC-like结构域建profile就能把散落在海量序列里的“疑似剪刀”捞出来。但这一轮捞出来的还是太多假阳性率很高因为很多普通核酸内切酶、限制性内切酶也带类似RuvC滤布结构。这时候AI就派上用场了对候选蛋白批量跑AlphaFold或ESMFold结构预测再用Foldseek做结构相似度比对。蛋白质结构比氨基酸序列保守得多很多序列同源性只有百分之十几的蛋白结构上却能完美叠合。这一步等于把候选列表按“立体形状像不像剪刀”重新排序比单看序列可靠得多。如果算法团队是Anthropic这个级别的我相信他们还会用蛋白质语言模型做语义搜索把蛋白序列编码成embedding用近似最近邻检索直接找“语义上的远亲”而不是只等BLAST结果。这种搜索引擎式的新酶发现是传统生信流程不具备的优势。3.3 试矿拿到候选蛋白后细胞实验怎么快速验证干实验筛出一批候选蛋白只是万里长征第一步。真正的分水岭在湿实验验证。对新发现的类CRISPR蛋白验证流程通常是先合成密码子优化后的基因在体外无细胞系统或大肠杆菌里表达然后设计几条候选guide RNA检测蛋白能否在RNA引导下切断目标DNA确认有切割活性后再用PAM富集库测定它到底偏好什么PAM序列。做得更完整的团队会把候选蛋白直接转到人胚肾293T细胞或小鼠细胞里做编辑实验用T7E1酶切检测或靶向NGS测序统计indel率。这里我得说一个经验从微生物基因组挖出的蛋白进真核细胞后最常见的死法不是没活性而是“表达了但不稳”或者“导向RNA没被正确处理”。所以真正能落地的类CRISPR系统背后都有一段漫长的蛋白工程改造过程比如加核定位信号、突变去毒性、调整RNA骨架。干实验给出方向但改造才是工具化的灵魂。Anthropic如果只是“挖到了”一个系统性新蛋白而没有配套的蛋白工程数据那它目前的阶段就还在“实验室里刚看到亮光”距离可交付的工具型产品还有相当一段路。4. 如果这个类CRISPR系统真的稳定可用改变的远不止实验室4.1 基因治疗和细胞治疗小体积酶带来的递送红利基因治疗领域最卡脖子的环节之一就是递送。现在最常用的AAV病毒载体包装容量大约是4.7kb一个SpyCas9全长蛋白编码序列就占掉差不多4.2kb剩下点空间连一个像样的启动子都塞不进去更别说同时装guide RNA和调控元件。这就导致很多体内基因编辑方案不得不拆成两条AAV分别装载蛋白和guide RNA再靠体内重组拼起来效率低、故障多。如果Anthropic挖到的是IscB或TnpB风格的小型酶蛋白编码只有400到600个氨基酸那整个局面立刻不一样一个AAV就能装下“启动子小酶guide RNA附属元件”单载体递送方案从不可能变为可能。对眼科、神经肌肉、肝脏代谢类疾病的体内编辑这是质的差别。哪怕只多一个能用的新PAM也意味着某些基因突变位点第一次有了可设计的编辑靶点。4.2 快速诊断与田间场景RNA切割活性的新想象力类CRISPR系统里如果新酶恰好具有Cas13那种“结合靶标RNA后触发非特异切割”的反式切割活性它就是天然的核酸检测模块。SHERLOCK诊断方案的核心逻辑就是把Cas13和报告RNA放进一个体系里样本里有目标核酸Cas13被激活顺带把报告RNA切断产生荧光信号或试纸条显色。这个方案最大的好处是不需要复杂仪器适合基层检测和田间诊断。新系统的价值在于提供更多“酶的选择”尤其是PAM/PFS偏好不同、工作温度更宽、体积更小的新酶能让检测panel在开发时少做很多妥协。叠加Anthropic这类公司本来就擅长的数据分析未来甚至可能出现“AI设计检测探针新酶诊断”的完整闭环。4.3 合成生物学和农业育种把“编辑”做成模块化组件合成生物学正在把生物细胞改造成微型工厂产药物、产材料、产燃料。改造过程中多基因编辑是高频需求。现有工具在植物里编辑时需要依赖富含GC或AT的区域选择合适的靶点PAM限制直接决定了很多位点“有想法但没工具”。类CRISPR系统如果能提供新的PAM偏好和不同切割末端就等于给植物育种人员、微生物工程人员多塞了几把不同尺寸的螺丝刀。比如Cas12a偏好T-rich PAM对很多高AT含量的基因组特别好用但某些物种GC含量高这时候一个偏好G-rich或C-rich的新系统就成了刚需。农业育种上低脱靶、高特异性的新酶还能帮助更快地做性状筛选不用一遍遍杂交回交。当然这些前景全部建立在“系统稳定可用”的前提上。一个新系统从论文到工具化中间隔着稳定性、特异性、脱靶率、递送效率、免疫原性每一环都是工程活。5. 我的判断这则消息现在处于什么阶段未来该盯哪些信号5.1 公开材料能支持到什么程度不要高估也不要低估先说我的判断目前围绕“Anthropic挖出类CRISPR新系统”的公开信息更像是实验室阶段的重要信号而不是已经完成工具化的产品发布。我看了一下手头能接触到的公开材料官方正式论文或演示Demo都还没有上线讨论更多来自社群转述、招聘动向和一些会议摘要级别的片段。这意味着两件事。第一不应高估到“Anthropic马上要发布新基因编辑工具”的程度第二也不应低估因为这类消息很少空穴来风。AI公司开始认真构建从序列挖掘到蛋白验证的内部闭环这件事本身已经是行业里一个值得记录的转折信号。判断这个消息的含金量我习惯用一个三阶段框架干实验发现新蛋白是第一级信号湿实验证明可编程切割并测定PAM是第二级信号完成真核细胞编辑、脱靶评估、蛋白工程改造是第三级信号。标题里的“挖出了”大概率在第一级到第二级之间。对做基础研究的开发者来说这已经足够启发一批新课题了。5.2 后面值得跟踪的几个节点预印本、专利、试验数据接下来想跟进这件事重点盯几个信号源。第一是预印本平台bioRxiv和arXiv上如果出现Anthropic实验室署名的核酸酶挖掘文章那基本可以确认消息成真。第二是专利数据库新酶发现通常会在论文之前先申请专利去WIPO或美国专利商标局查“Anthropic”和“nuclease”“CRISPR-like”组合经常能比新闻稿早几个月看到实质内容。第三是官方博客和招聘页面如果实验室在招蛋白质工程、湿实验方向的岗位说明管线已经过了纯计算阶段正在补实验验证和产品化的人手。我自己的习惯是每周用固定关键词扫一轮关键词包括“OMEGA system”“RNA-guided nuclease”“TnpB”“IscB”“Fanzor”“metagenome mining”。这类领域如果真有大动作早期论文和专利之间的时间差通常足够让有心人提前布局。5.3 想跟进这个方向可以先准备什么如果你看完这些也对“AI挖新酶”感兴趣我给三个可直接落地的建议。第一步把HMMER和HHpred的基础用法过一遍找一份已知Cas蛋白的种子序列跑通一个从数据库下载到候选输出的最小流程。这个流程不复杂半天就能跑通但能让你对“远亲搜索有多难”有真实的体感。第二步订阅几个关键数据库的更新NCBI的GenBank每周更新、MGnify的宏基因组新数据集、JGI的IMG最新释放。新系统发现的第一现场往往是这些沉默的数据更新而不是热闹的新闻稿。第三步有条件的话在本地部署一个ESMFold或用免费的AlphaFold服务跑一批结构预测理解“序列差异大但结构相似”是怎么一回事。真正看懂这个就基本能读懂所有类CRISPR发现论文的核心逻辑了。最后说点我的个人体会。在这个领域泡久了会发现数据库里的蛋白质其实比论文多好几个数量级缺的从来不是“矿”而是能把矿捞出来并验证的方法。Anthropic这类公司如果真的把语言模型的检索能力用在新酶发现上哪怕最后不是这一个系统整个领域也会被这种“AI挖矿”的方式重塑。消息是真是假时间会给出答案但趋势已经摆在这里了。