ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AlphaFold 零基础上手:一条 FASTA 序列到 3D 蛋白质结构预测的完整流程

AlphaFold 零基础上手:一条 FASTA 序列到 3D 蛋白质结构预测的完整流程 AlphaFold 零基础上手一条 FASTA 序列到 3D 蛋白质结构预测的完整流程【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold想查一个蛋白质的三维结构但 PDB 里查不到它的实验结构。把仓库克隆下来后AlphaFold 可以直接从一条 FASTA 序列生成结构预测。读完后你能在一台带 GPU 的 Linux 机器上跑通下载数据库 → 写 FASTA → 拿到 ranked_0.pdb 结构文件的完整链路并看懂附带的 pLDDT 置信度文件。 先看到最终效果这一节先回答跑完一次预测你拿到的是什么。上图是官方的 CASP14 评测动画预测结构与实验测定结构叠加旋转对比两者几乎完全重合。本地跑完后输出目录里会得到 ranked_0.pdb置信度最高的最终结构、unrelaxed_model_1.pdb 和 confidence_model_1.json每个残基的 pLDDT 置信度可直接用 PyMOL 或 ChimeraX 打开检查。⏱️ 原理三分钟讲清用两句话分清谁负责哪一段方便上手时定位问题出在哪一步。整条链路分两段数据准备与模型推理。数据段由 alphafold/data/pipeline.py 驱动调用 JackHMMER、HHblits 等外部工具把你的序列拿去大规模序列数据库检索产出 MSA多序列比对推理段由 JAX 网络把 MSA 和结构模板特征转成三维坐标最后用 Amber 力场做结构松弛消除立体化学冲突。入口是 docker/run_docker.py它把 FASTA 文件和数据库挂载进容器内部调用 run_alphafold.py 的 predict_structure 完成全部流程。原理pLDDT0-100是模型对每个残基的置信度越接近 100 表示该处结构越可信。置信度会写进 PDB 的 B 因子列在结构软件里可以渲染成颜色带。 上手操作从输入到出结果的三步以下命令都在仓库根目录执行默认环境为 Linux、Docker 与 NVIDIA GPU三步按顺序做即可。第一步下载数据库并构建推理镜像这一步完成数据与环境准备是后面所有预测的前提。git clone https://gitcode.com/GitHub_Trending/al/alphafold cd alphafold bash scripts/download_all_data.sh /data/alphafold_data download.log 21 docker build -f docker/Dockerfile -t alphafold . pip3 install -r docker/requirements.txt下载脚本会在后台拉取 BFD、UniRef、MGnify 等序列数据库与模型参数镜像则预装好 HHblits、OpenMM 等全部外部工具。注意下载目录 /data/alphafold_data 不要放在仓库目录内部否则大量数据会被复制进 docker build 上下文构建会明显变慢。第二步把蛋白质序列写成 FASTA 文件模型的唯一必需输入就是一个两行的 FASTA 文件第一行以 开头的名称第二行是氨基酸序列。example_protein MAAAVSLGQRLLQGLLLRGYQCGLFDPGDAPPGC预期效果保存为 example_protein.fasta 即可若序列含非标准氨基酸或短于 16 个残基官方 notebook 中的 clean_and_validate_single_sequence 校验会先拒掉它所以动手前先把序列核对好。第三步运行 run_docker.py 等待结构文件这条命令一次性完成 MSA 检索、5 个模型推理和松弛只需等日志跑完。python3 docker/run_docker.py \ --fasta_pathsexample_protein.fasta \ --max_template_date2022-01-01 \ --data_dir/data/alphafold_data \ --output_dir/home/user/alphafold_output预期效果运行结束后输出目录里出现 ranked_0.pdb最终结构、unrelaxed_model_1.pdb 与 confidence_model_1.json每残基 pLDDT这就是全流程的交付物。❓ 常见问题与解法第一次跑最容易卡住的三个问题。数据库太大下不动怎么办完整库约 556 GB大头是 BFD 与 UniRef磁盘紧张就换用 reduced_dbs 精简配置bash scripts/download_all_data.sh /data/alphafold_data reduced_dbs运行命令再追加--db_presetreduced_dbs。代价是 MSA 覆盖变稀疏部分困难序列的预测质量会下降。怎么判断预测结果可信不可信看两个文件confidence_model_1.json 里有逐残基的 plddt 与均值均值高于 80 通常说明骨架可靠低于 50 的区域要谨慎对待、以实验验证为准relax_metrics.json 报告松弛后的剩余立体化学冲突数冲突越多说明该模型结构质量越差。序列的 MSA 覆盖情况怎么看想确认序列哪些位置被同源序列覆盖得好可以用 alphafold/notebooks/notebook_utils.py 里的 show_msa_info 画逐位点非缺口氨基酸计数曲线通常在官方 Colab notebook 里调用notebook_utils.show_msa_info(single_chain_msasmsas, sequence_index1)曲线低平的位置说明 MSA 信号弱对应区域的预测置信度一般也偏低。 进阶想做得更细时在 monomer 默认配置之上有三个常用开关一是加--model_presetmultimer用 AlphaFold-Multimer 模型折叠多链蛋白质复合物二是--models_to_relaxall对 5 个模型全部松弛耗时长但拿到更多可比对的结构三是--use_precomputed_msastrue在同一输出目录复跑时直接复用已算好的 MSA跳过最耗时的数据库检索阶段。技巧交互式演示与序列校验示例见 notebooks/AlphaFold.ipynb模型架构与推理细节读 docs/technical_note_v2.3.0.md。目标从此刻起只差一个文件写进 FASTA跑完上面三步就能拿到带置信度评分的结构。建议先用一条约 200 个残基的蛋白质试跑确认流程无误再上 full_dbs 或 multimer。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表