ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DAP-seq技术解析大豆转录因子调控种子含油量的研究设计与实操

DAP-seq技术解析大豆转录因子调控种子含油量的研究设计与实操 要我说做植物分子生物学研究的人这几年没少被“转录因子到底结合了哪些靶基因”这个问题折磨。特别是在大豆这种基因组又大、重复序列又多、遗传转化周期还特别长的作物里想用传统方法去找一个转录因子的下游靶基因光是抗体和材料这两关就能卡掉大半的课题组。所以当我看到JIPB上这类用DAP-seq做大豆转录因子调控种子含油量研究的项目文章时第一反应是这条路终于被大家走通了。DAP-seq全称DNA Affinity Purification Sequencing翻译过来就是DNA亲和纯化测序。名字听着绕但思路其实很直白把转录因子蛋白在体外表达出来直接拿去和基因组DNA文库孵育然后把结合下来的DNA片段洗出来测序就能知道这个转录因子在基因组上大概结合在哪些位置。相比ChIP-seq它把最要命的“体内染色质免疫共沉淀”和“特异性抗体”这两个步骤直接绕过去了特别适合大豆这种非模式作物。这篇文章背后真正值得琢磨的不是技术本身有多新而是整个研究设计怎么把DAP-seq和含油量这个复杂性状串联起来从几万个peak里筛出真正有调控价值的那几个靶基因。这篇文章就把这条链路拆开讲透。1. 项目背景与研究思路为什么锁定大豆转录因子和含油量1.1 大豆含油量研究的“卡脖子”环节大豆种子含油量是一个典型的多基因控制的数量性状摸清它的调控机制对高油育种的意义不用多说。这些年大豆上做过大量QTL定位和GWAS分析发表在各类期刊上的位点一抓一大把可真正落到基因层面的却不多。原因在于QTL定位的区间往往还有几百Kb甚至几Mb区间里躺着几十上百个基因光靠遗传连锁很难锁定哪一个是主效基因。而转录因子在这个问题里恰恰是一个很好的突破口。油脂合成通路里的关键酶基因比如参与脂肪酸从头合成的、参与甘油三酯组装的它们的表达量高不高很大程度上取决于上游转录因子对它们启动子的结合和激活。像WRI1、LEC1、LEC2、FUS3这些名字做油脂研究的人闭着眼都能写出来它们确实在拟南芥里被验证得明明白白可一旦换到大豆里情况就复杂多了。大豆是古多倍体很多基因都有多个拷贝同一个转录因子可能有三个甚至四个同源基因它们的表达模式、结合位点、下游靶基因是不是还跟拟南芥一样都很难说。这里就遇到一个很现实的问题你手里有一个大豆转录因子比如某个WRI1的同源蛋白你推测它参与种子含油量调控但你不知道它在基因组上到底结合了哪些基因的启动子。没有这个信息后面的遗传验证、分子机制研究全都无从下手。过去的做法要么是Y1H筛文库效率低而且只能验证一对一的关系要么就是ChIP-seq可大豆里很多转录因子根本买不到好用的抗体更别说要在大豆种子这样的特定组织中做染色质免疫共沉淀那材料的准备难度做过的人都知道真是劝退级别的。1.2 DAP-seq相比ChIP-seq和Y1H赢在哪里DAP-seq在原理上做了一次讨巧的简化。它不再依赖于细胞内转录因子与染色质的天然结合而是把转录因子的编码序列克隆到带有亲和标签的表达载体上利用无细胞表达系统在体外合成蛋白再让这个重组蛋白去和片段化的基因组DNA文库孵育。蛋白和DNA结合之后用亲和磁珠把蛋白-DNA复合物一起拉下来洗掉非特异结合的片段剩下的DNA经过PCR扩增后直接上机测序。这么做的第一个好处就是绕开了抗体问题。ChIP-seq的核心前提是要有一支特异性好、富集效率高的抗体而DAP-seq只需要一个通用的标签抗体或标签亲和磁珠就能捕获所有不同转录因子的复合物。第二个好处是周期短。ChIP-seq从材料准备、交联、染色质打断、免疫沉淀到建库一套流程顺利也要两三周而DAP-seq从拿到克隆到建库测序熟练的话一周之内就能完成一轮实验。第三个好处是门槛低需要的植物材料只是提取基因组DNA不需要昂贵的抗体和特殊的仪器设备。当然DAP-seq也有它的短板这后面我会专门讲。但就研究设计而言它的优势恰好击中了大豆转录因子研究的痛点。所以这篇文章选择DAP-seq来解析大豆种子含油量相关转录因子的调控网络是非常合理的切入点既不需要依赖大量前期材料积累又能在相对短的时间内获得全基因组范围内的结合图谱。2. DAP-seq实验设计与核心环节实现2.1 gDNA文库构建与体外表达体系的搭配DAP-seq的第一步是构建基因组DNA文库这一步的质量直接决定后面所有结果的好坏。具体操作是把提取好的大豆基因组DNA用超声打断成300到500bp左右的片段然后经过末端修复、加A尾、连接测序接头做成一个可以直接上机的gDNA文库。这里有几个细节值得注意。超声打断的片段范围不要太宽如果出现明显的双峰说明打断不均匀应该重新处理。片段太大或者太小都会影响后续洗脱片段的代表性和比对率偏大的片段在孵育时容易带出非特异结合的背景偏小的片段又可能在PCR扩增时被优先放大导致数据偏差。这里我自己做过的经验是打断后的DNA一定要用磁珠做一次两轮分选把片段大小收窄到400bp上下宁可损失一点产量也要保证文库的均一性。因为后面peak calling的时候如果文库里的片段长短差异太大会在基因组某些区域造成假信号特别是重复序列区域这种问题会非常明显。体外表达体系的选择上目前做DAP-seq用得比较多的是基于麦胚或兔网织红细胞的无细胞表达系统。两者的区别在于麦胚体系成本更低背景蛋白少但操作流程稍复杂兔网织红细胞体系蛋白折叠更接近天然状态但价格也更贵。预算充足的话我更倾向兔网织红细胞体系特别是一些比较大或者结构比较复杂的转录因子蛋白折叠正确与否会直接影响DNA结合活性。表达载体上需要带上亲和标签常见的选择是HaloTag或Protein A后面捕获的时候用的磁珠要和标签匹配比如HaloTag用HaloLink磁珠Protein A用IgG磁珠。2.2 孵育、捕获与洗脱环节的关键细节蛋白和gDNA文库的孵育是整个实验的“题眼”。DAP-seq的经典流程里一般会先把体外表达的蛋白固定在磁珠上然后再加入gDNA文库进行孵育。固定这一步很有讲究蛋白和磁珠的比例要事先做一个小体系滴定加多了磁珠表面过于拥挤会影响蛋白的空间构象导致结合效率下降加少了又拉不到足够的DNA。孵育的温度和时间同样要优化我一般先用4度孵育1小时加室温孵育20到30分钟的组合这个组合在大多数转录因子上都能拿到比较稳定的结果。如果目标转录因子结合比较弱可以适当延长到4度过夜孵育但伴随而来的就是背景升高所以一定要设置足够的阴性对照来判断信噪比。洗脱环节是另一个容易翻车的地方。洗得不够背景高peak看不出来洗得太狠特异结合也可能一起被洗掉。常规做法是用含不同浓度盐的缓冲液逐步清洗从低盐到高盐每一步都能去掉一部分非特异结合的DNA。具体用什么样的盐浓度梯度不同实验室有不同偏好但我建议至少要做一次盐浓度梯度预实验用qPCR检测一个已知靶标的富集程度来确定最优清洗条件。这在正式实验之前花半天时间就能完成却能省下后面一大堆麻烦。洗脱下来的DNA要用PCR进行扩增富集这一步循环数要控制好通常12到14个循环就够了。循环数太多会产生明显的PCR重复特别是在数据量比较大的情况下会造成生物学重复之间的重复率差异变大。文库扩增之后记得做一次纯化把引物二聚体去掉否则会影响测序的簇生成效率。2.3 测序数据量与实验对照怎么定测序数据量的设计很多第一次做DAP-seq的人容易犯两个极端。一个极端是看得太简单觉得DAP-seq没有ChIP-seq那么复杂每个样本随便上5M reads就够了另一个极端是数据量给得夸张单样本100M reads浪费钱还不一定换来更多的peak。根据我自己的经验DAP-seq一般单样本给20到50M的双端150bp reads是够用的。大豆基因组大概1.1Gb保守估计下来在40M reads的深度下大部分区域都能获得足够的覆盖率来支撑peak calling。这里要特别强调对照的设置。DAP-seq的对照组是“不加蛋白的gDNA文库”也就是把相同量的gDNA文库直接做一遍相同的磁珠孵育、洗脱和PCR扩增流程只是不加转录因子蛋白。这个对照能反映出磁珠本身和接头序列对DNA的非特异吸附情况是后续peak calling时用来扣除背景的基线。如果对照的背景信号都很高那说明磁珠或者洗脱步骤有问题应该先解决对照再处理样本。另外多做几个生物学重复也很有必要DAP-seq虽然是体外实验但蛋白表达批次的差异、操作过程中细小的波动都可能导致重复之间的一致性不理想一般来说三个重复比较稳。3. 从Peak到机制数据分析与功能验证的完整链条3.1 peak calling、motif分析和靶基因注释拿到测序数据之后首先是一套比较标准的生信分析流程。原始数据先做质量控制去掉低质量碱基和接头序列然后比对到大豆参考基因组上。DAP-seq数据的比对结果和ChIP-seq很不一样ChIP-seq的信号通常集中在少数几个离散区域而DAP-seq在体外条件下转录因子结合的位点可能会更多更散所以在peak calling的时候参数要做相应调整。MACS2是用的比较多的工具跑的时候建议用更宽松的q值阈值我一般用q0.05因为体外结合的数据往往没有体内那么强的富集度阈值太严真正的结合位点会被漏掉。peak calling之后下一步是motif分析。每个转录因子都有自己的DNA结合偏好通过HOMER或者MEME对显著peak区域的序列做motif富集往往能找到这个转录因子的核心结合基序。这一步对数据质量判断很有帮助。如果你研究的转录因子所属家族的已知基序被富集出来了那说明这套DAP-seq实验是成功的后续的靶基因分析才靠谱。我在分析中见过不少情况DAP-seq数据整体看起来还行但motif富集完全找不到已知基序后来一排查发现是体外表达的蛋白没有正确折叠导致结合特异性很差。所以motif分析结果相当于一个内置的质量控制指标一定要重视。靶基因注释这一块最常用的做法是把peak区域关联到距离最近的基因上。大豆基因组的基因密度不算高平均下来大概每十几个Kb一个基因所以peak离基因的距离远近可以作为比较粗略的关联依据。一般取peak summit与基因转录起始位点TSS的距离在2Kb以内作为直接靶基因的候选。不过这个标准也不是绝对一些远端增强子类的结合位点可能在更远的地方也能发挥调控作用所以也可以结合H3K27ac等组蛋白修饰数据来辅助判断。如果实在没有表观组数据那就先从2Kb以内的候选做起再加上motif在启动子区的分布信息筛出的一批靶基因往往已经比较能说明问题了。3.2 把DAP-seq数据嵌进油脂代谢调控网络当拿到一批候选靶基因之后最核心的一步是把它们放到生物学通路里去理解。对种子含油量这个性状来说主要的代谢通路包括脂肪酸从头合成、脂肪酸碳链延伸与去饱和、甘油三酯(TAG)组装以及脂质储存蛋白的合成等。这些通路里的结构基因作为转录因子的直接靶标调控关系是最清晰的。如果DAP-seq数据显示某个转录因子同时结合了脂肪酸合成通路里三四个关键酶的启动子那它很可能是一个上位调控节点。当然只做功能富集远远不够。同一批靶基因里有些可能是直接调控油脂合成的有些可能是调控糖代谢、氨基酸代谢等其他与碳源分配相关的通路。因为这些通路与油脂合成竞争共同底物比如糖酵解产生的丙酮酸是脂肪酸合成的前体而糖代谢和氨基酸合成也在消耗碳源。所以转录因子到底把碳流向哪个方向往往反映了它在整个代谢网络中的角色。从这个角度去解读DAP-seq结果能比单纯盯着油脂合成基因写出更多有意思的生物学结论。一个比较主流的研究框架是把DAP-seq数据和转录组数据进行整合分析。比如拿到转录因子在种子的不同发育阶段的表达量之后看看它和DAP-seq靶基因的表达是否呈正相关或者负相关。如果一个基因在DAP-seq里被结合同时它的表达量随着转录因子表达量的升高而显著上升这个靶基因的证据强度就高了一层。如果又有遗传材料能证明转录因子突变后这个靶基因确实下调那基本就能把TF-靶基因-表型这条逻辑链串起来了。这也是这篇文章所属的那类研究范式里最有说服力的部分。3.3 功能验证的几条可行路径DAP-seq本质上是一个高通量的体外筛选手段它的结果只能说明“有这个结合的可能性”不能直接证明“在体内真的调控这个基因”。所以后续的功能验证一步都省不了。常见的验证路径可以分为三个层次。第一个层次是分子结合验证用EMSA或者双荧光素酶报告系统来验证转录因子对靶基因启动子是否有直接结合和转录激活或抑制活性。EMSA是最快的一种体外表达蛋白和标记过的启动子片段孵育跑胶看有没有阻滞条带。双荧光素酶实验则是在烟草叶片里瞬时共表达转录因子和带有目的启动子的报告载体观察荧光素酶活性的变化。这两个实验做完结合关系基本上就比较扎实了。第二个层次是遗传材料的表型验证。大豆的稳定遗传转化周期太长所以很多人会先用发根农杆菌介导的毛状根体系做快速的功能初筛或者用大豆籽粒瞬时表达体系来验证基因功能。要研究种子含油量最好还是要有稳定的过表达或基因编辑材料用近红外光谱仪或者气相色谱来做含油量测定。这一步周期比较长但是最终的说服力是最强的。第三个层次是高阶的基因调控网络验证。比如构建转录因子突变体后做转录组测序对比DAP-seq靶基因在突变体中的表达变化进行更系统的分析。如果条件允许还可以做DAP-seq靶基因区域的选择性验证比如ChIP-qPCR或原位表达分析把体外结合数据和体内的自然状态连接起来。对于发文章来说三个层次里至少做到前两个加上转录组学的支持已经能形成比较完整的故事了。4. 实操中踩过的坑与排查心得4.1 高频问题速查表做DAP-seq不像跑个PCR那么简单从蛋白制备到数据分析每一步都可能出现让你摸不着头脑的情况。我把实际过程中遇到的一些高频问题整理成了一张速查表方便对照排查。现象可能原因排查与解决方案测序后peak信号非常弱体外表达的蛋白量不足或活性差检测蛋白产量换用麦胚/兔网织体系对比增加蛋白与文库比例背景高peak不清晰孵育条件太宽松或磁珠非特异吸附过多增加盐浓度洗脱缩短孵育时间做磁珠对照比较背景生物学重复间peak重叠率低文库片段不均匀或建库批次差异重新打断gDNA并磁珠双轮分选统一同一批次的文库用于所有重复motif分析找不到已知基序蛋白结合特异性差或表达标签影响折叠换表达体系验证标签位置用阳性对照转录因子跑全流程测试peak大多落在重复序列区基因组注释不完整或重复序列比例高使用RepeatMasker过滤重复区域比对结果用更严格的唯一比对参数数据量分配不均各样本测序量差异过大建库后做Qubit和qPCR定量校准Pooling前再次精确定量这几个问题基本覆盖了从湿实验到干实验的常见坑。我个人觉得第一次做DAP-seq最好先拿一个已知的、启动子结合位点非常清楚的转录因子做一次全流程预实验。比如一些在拟南芥里结合基序已经极度明确的转录因子换到大豆里去跑一遍看看标准流程下能不能重现已知的motif。如果连这个阳性对照都跑不出来那肯定是流程里某个环节有问题这时候去折腾真正的研究目标只会把时间浪费在一堆莫名其妙的信号上。4.2 我自己觉得最值得记住的几条经验先说关于DAP-seq的一个常见误解。很多人以为DAP-seq拿到一堆peak就等于找到了转录因子在体内的全部靶基因。实际上DAP-seq反映的是体外条件下的结合潜力它缺少了体内染色质的可及性、组蛋白修饰、其他竞争性蛋白等因素。换句话说DAP-seq能找到的是一个名录但这个名录上的每一个条目是否真的会在体内被用到还需要大量验证。所以做这个实验之前心态要摆正。DAP-seq是帮我们快速收窄候选范围从“大海捞针”变成“攥着几十根针挑一挑”而不是给出最终答案。第二条经验是关于启动子区的关联策略。很多人在注释靶基因时只看最近的基因在基因密度比较高的区域这种方法很容易把真正被调控的基因漏掉。我后来养成了一个习惯对peak关联基因时同时看这两个peak所在区域的表达相关数据比如ATAC-seq的染色质开放性信号和配对转录组的基因表达情况。如果某个peak区域有较强的开放信号而且对应的基因和转录因子在同一时空表达那即使它不是最近的基因这个关联的优先级也应该提高。这个思路在整合多组学数据写文章时也更有说服力。还有一条关于重复和批次效应的经验。DAP-seq的建库环节非常稳定真正波动大的反而是蛋白表达那一步。不同批次的体外表达蛋白即使浓度看起来一样活性也可能相差不少。所以我会把同一轮孵育的所有样本的蛋白都放在同一批表达里完成避免不同批次间产生系统偏差。建库后的测序最好也是一次性把重复全部送样而不是分多次上机。分批上机虽然也能通过数据归一化来校正但在实际分析中批次效应还是会悄悄影响一些边界区域的peak判断。最后要说的还是那句话DAP-seq只是一个工具真正能把故事讲好的关键依然在于研究设计是否想清楚了“这个转录因子是在哪个发育阶段、哪个组织里发挥功能它的靶基因在通路的哪个节点上”。先把这个问题想明白再去做实验、分析数据、选靶基因每一步才都落在点子上。工具再有优势也得靠清晰的生物学问题来驾驭这个定律在大豆油脂研究里适用在大多数功能基因组学研究里也同样适用。
返回列表