
AlphaFold 输出文件解析5 个文件看懂预测结构与置信度【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold跑完一次预测输出目录里会落下一串文件unrelaxed_model_1.pdb、relaxed_model_1.pdb、ranked_0.pdb、confidence_model_1.json……先打开哪个哪个最可信这份 AlphaFold 输出文件解析指南带你按顺序过 5 个核心文件从原子坐标到逐残基置信度再到挑出最好的模型一次讲清。扫一遍核心文件谁管坐标谁管置信度先给一张总表每个文件只回答一个问题看完你就知道该翻哪个。文件格式用途关键字段生成位置relaxed_model_N.pdb / ranked_N.pdbPDB蛋白三维结构B 因子列存 pLDDTx/y/z 坐标、B 因子alphafold/common/protein.pyconfidence_model_N.json逐残基 pLDDT 评分residueNumber、confidenceScore、confidenceCategoryalphafold/common/confidence.pypae_model_N.json残基对之间的预期距离误差predicted_aligned_error、max_predicted_aligned_erroralphafold/common/confidence.pyranking_debug.json多个模型的排序与依据order、plddts多聚体为 iptmptmrun_alphafold.pyresult_model_N.pkl / features.pkl模型原始输出与输入特征plddt、predicted_aligned_error 等run_alphafold.py三类信息分得很清楚PDB 管结构长什么样两个 JSON 管可信度有多高ranking 文件管选哪个模型。读结果时按这个顺序走就不会来回翻。一句话总结先分清结构、置信度、选型三层文件再看细节效率最高。读懂 PDB 里的 B 因子列PDB 是最通用的结构格式。标准 PDB 里 B 因子温度因子记录原子抖动程度AlphaFold 借这个位置写了 pLDDT——模型对每个残基位置有多大把握。这个赋值发生在 run_alphafold.py 里就这几行# Add the predicted LDDT in the b-factor column. plddt_b_factors np.repeat( plddt[:, None], residue_constants.atom_type_num, axis-1) unrelaxed_protein protein.from_prediction( features..., resultprediction_result, b_factorsplddt_b_factors)也就是说同一个残基的所有原子共享同一个 pLDDT 值。一行 ATOM 记录长这样ATOM 1 N MET A 1 8.500 2.300 1.100 1.00 92.50 N逐项说原子名 N、残基 MET、链 A、残基序号 1后面三组是 x/y/z 坐标单位 Å1.00 是占有率92.50 就是 B 因子即 pLDDT末尾 N 是元素。怎么用于决策把 relaxed_model_1.pdb 拖进 PyMOL 或 ChimeraX按 B 因子着色把握大的区域一个颜色拿不准的区域另一个一眼扫完。目录里还有 unrelaxed 版本那是松弛前的原始结构只用来对比。Amber 松弛过程在 alphafold/relax/relax.py 中记录优化前后的 RMSD数值小说明原始预测已经很稳。一句话总结PDB 的 B 因子列就是逐残基 pLDDT按它着色即可快速定位低置信区域。看懂 pLDDT 评分的四个档位pLDDT 是模型给每个残基打的把握分范围 0–100。它的来源是 alphafold/common/confidence.py 里的compute_plddt先把网络输出做 softmax 变成概率分布再乘各档位中心值取期望最后乘 100 换算成分数。分数会落进四个档由_confidence_category函数负责分档if 0 score 50: return D if 50 score 70: return L elif 70 score 90: return M档位分值区间常见含义H90–100结构明确可放心使用M70–89中等置信局部可能略有摆动L50–69较低置信多为柔性或波动区域D0–49极低置信常对应天然无序区逐残基的分数保存在 confidence_model_1.json内容很直白{residueNumber:[1,2,3,4,5], confidenceScore:[92.5,88.3,76.2,61.5,45.3], confidenceCategory:[H,H,M,L,D]}三个数组一一对应残基序号从 1 开始分数保留两位小数档位就是上表的字母。 判断建议D 档不一定代表预测失败天然无序区域本来就摆不平。如果目标残基落在 L 或 D 档先别下结论接着看下一节的 PAE。一句话总结pLDDT 分四档H/M 档放心用L/D 档先查原因再用。用 PAE 矩阵判断相对位置可靠性pLDDT 管单个位置准不准PAE 管两个位置的相对关系准不准。Predicted Aligned Error 的单位是 ÅPAE[i][j] 越大模型对残基 i 和 j 的相对位置越没把握。它由compute_predicted_aligned_error对每对残基的误差分布求期望得到最终写进 pae_model_1.json{predicted_aligned_error:[[0.3,8.2],[8.2,0.4]], max_predicted_aligned_error:30.0}两个字段predicted_aligned_error是 N×N 矩阵N 为残基数max_predicted_aligned_error是误差分箱的上限画热图时它决定色标范围。怎么读这张矩阵三个习惯动作对角线附近整体偏低局部结构可靠这是正常形态远离对角线出现高值色块对应两个结构域的相对取向不确定别拿跨域距离做定量多聚体里跨链块整体偏高复合物界面本身就没预测稳需要实验验证。 判断建议活性位点、结合界面这类两点之间的问题一定用 PAE 复核只看 pLDDT 会漏掉相对取向的风险。一句话总结pLDDT 看单点PAE 看两点关系跨域距离以 PAE 为准。挑出最优模型ranked 文件与排序依据AlphaFold 默认对每条序列跑 5 个模型输出目录里会有 model_1 到 model_5 共五组结果。光看 pLDDT 均值选模型并不稳run_alphafold.py 用的是专门的 ranking_confidence排序后按名次写出 ranked_0.pdb 到 ranked_4.pdb。排序明细在 ranking_debug.json 里{ plddts: {model_1: 55.2, model_2: 62.4, model_3: 49.8}, order: [model_2, model_1, model_3] }order字段就是最终名次plddts是每个模型的排序依据用多聚体 preset 时这里会换成 iptmptm即基于 pTM 的指标。怎么用于决策日常分析直接用 ranked_0.pdb它来自置信度最高的模型若开启了松弛写的是松弛后坐标若 order 前两名分数接近说明结果对随机种子不敏感更可信分差大就把前两名都过一遍 PAE想深挖原始输出result_model_N.pkl 存了完整预测结果字典features.pkl 存了模型输入特征用 Python 的 pickle 模块加载即可。一句话总结ranked_0.pdb 是默认答案排序依据查 ranking_debug.json。从文件到质量判断的完整流程把前面的碎片串成一条流水线五步走选型打开 ranking_debug.json确认 order 第一名锁定 ranked_0.pdb。依据排序分数看结构把 ranked_0.pdb 载入可视化软件按 B 因子着色扫一遍整体形态。依据PDB B 因子列 pLDDT定置信对照 confidence_model_N.json统计 H/M 档占比标出 D 档区域。依据confidenceCategory验关系对关键功能位点或结合界面查 pae_model_N.json 对应残基块的数值。依据predicted_aligned_error查松弛看 relax_metrics.json 的 remaining_violations_count确认结构没有残留冲突。依据松弛残余项前四步回答选哪个、长什么样、哪里可信、哪里要复核第五步是兜底检查。一句话总结选型 → 结构 → 单点置信 → 相对置信 → 松弛兜底五步出结论。避坑几个最常见的误读⚠️pLDDT 很高但结构明显别扭。原因局部打分高不代表全局取向对两个结构域可能整体错位。 对策查 PAE 矩阵对角块外的高值区跨域距离一律存疑。⚠️一整段 pLDDT 很低被当成预测失败。原因天然无序区域本来就没有稳定结构D 档是模型在如实报告。 对策交叉比对文献或无序区预测别直接丢弃该区域。⚠️relaxed 和 unrelaxed 结构对不上。原因松弛会微调键长键角小幅度偏移属于正常现象。 对策看 relax_metrics.json残余项多或 RMSD 大时再人工复核。多聚体预测只看了 pLDDT。原因复合物更关键的是界面单链分数高不代表结合态可靠。 对策以 ranking_debug.json 里的 ptm/iptm 为准并重点看跨链 PAE 块。一句话总结高 pLDDT 不等于全局可信低 pLDDT 不等于失败都要交叉验证。核心就三层PDB 给结构pLDDT 给单点置信PAE 给相对位置置信再用 ranking_debug 选型。想深挖细节可看 docs/technical_note_v2.3.0.md 的说明。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考