
AlphaFold 预测置信度 pLDDT 与 PAE 完整指南【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold刚跑完 AlphaFold目录里躺着一串 confidence JSON、一张 PAE 矩阵、还有一份 B 因子被改写过的 PDB——pLDDT 均分 87 算高吗PAE 那个 50 该不该慌两个指标打架时听谁的这篇文章按源码把这两个指标的算法、读法和常见误读一次讲清。一、pLDDT 逐残基分数是怎么算出来的模型最后一层对每个残基输出一组 logitscompute_plddt把它们 softmax 成分数落在不同误差桶的概率分布再对分布求期望最后放大到 0–100。# 源码片段alphafold/common/confidence.py compute_plddt num_bins logits.shape[-1] bin_width 1.0 / num_bins bin_centers np.arange(start0.5 * bin_width, stop1.0, stepbin_width) probs scipy.special.softmax(logits, axis-1) predicted_lddt_ca np.sum(probs * bin_centers[None, :], axis-1) return predicted_lddt_ca * 100softmax 把 logits 归一成这个残基的 Cα 落在哪个误差桶的概率bin_centers是每个桶的中心值求期望后乘 100得到 0–100 的逐残基 pLDDTpredicted Local Distance Difference Test。pLDDT 回答的是这个残基自己的 Cα 位置预测得有多靠谱它是逐残基的不是一整条链的总分。源码里的四级标签 D / L / M / H源码把 pLDDT 切成四段每段一个字母标签见 confidence.py 的_confidence_category标签分数区间含义常见对应D0–50无序/非常低无序区、柔性连接L50–70低仅拓扑可信M70–90中等主干可靠H90–100高接近原子精度run_alphafold.py会把这套逐残基的分数连同标签写进confidence_model.json方便程序化处理。pLDDT 的三种读法pLDDT 还被写进输出 PDB 的B 因子温度因子列所以在分子可视化软件里按 B 因子着色就能直接看到每段残基的置信度。全链都在 M/H整条链可信可放心做下游分析N 端或 C 端掉到 D多为末端无序属正常链中间突然掉到 D多半是结构域之间的连接肽。单链读到这里就够了但结构域之间怎么摆、复合物亚基之间怎么相对摆放这类问题pLDDT 回答不了得看 PAE。二、PAE 矩阵怎么读单条链的 pLDDT 只能回答这个残基自己站得稳不稳。PAEPredicted Aligned Error预测对齐误差把残基对级别的不确定性装进一个 N×N 矩阵。模型对每个残基对 (i, j) 输出一组误差桶 logitssoftmax 后变成这两个残基对齐后距离误差落在哪个桶的概率分布取期望得到 PAE$$ \mathrm{PAE}{ij}\sum{k} p_{ij k}, c_k $$白话对每一对残基把每个误差桶的概率 × 该桶中心误差加起来就是这对残基最可能的对齐距离误差越大说明这对残基的相对位置越不可信。完整实现在 compute_predicted_aligned_error输出矩阵与max_predicted_aligned_error最大可能误差取自最后一个误差桶中心。对角线与非对角区块读 PAE 时找三样东西对角线应接近 0局部残基对位置可靠整块深色区对应一个结构域或一个亚基块内相对位置可信跨块浅色说明结构域之间、亚基之间的取向不确定。多结构域蛋白的 PAE 常呈棋盘状域内块深、跨域块浅是判断结构域边界最直接的信号复合物里不同链的非对角块则直接反映亚基间置信度。三、把两个指标串起来看PAE 和 pLDDT 同源信号常常一致但也有组合信号需要单独判断。当 pLDDT 与 PAE 给出不同结论时信号组合可能含义该怎么办pLDDT 高PAE 跨域块浅链内稳相对取向存疑重点看 PAE 非对角块pLDDT 局部低PAE 局部块深柔性连接/连接肽标记后做动力学验证pLDDT 整体低PAE 整体浅全局形状可信原子细节不可靠适合 docking 粗定位pLDDT 均值、pTM 与模型排名模型后处理还会从同一份 PAE 分布算出 pTMpredicted TM-score对全部残基对取期望和 ipTMinterface pTM只对跨链残基对取期望。单链预测的排名置信度就是 pLDDT 均值复合物预测则是0.8·ipTM 0.2·pTM见 model.py 的get_confidence_metrics# 源码片段alphafold/model/model.py 模型排名置信度 if not multimer_mode: confidence_metrics[ranking_confidence] np.mean( confidence_metrics[plddt]) # 复合物confidence_metrics[ranking_confidence] # 0.8 * iptm 0.2 * ptmpLDDT 管链内好不好pTM 管全局/界面好不好ranking_confidence把它们合并成一个数用于在多模型中排序。四、三个最常见的误读把 pLDDT 均值当唯一指标链均分 85 但中间一段塌到 40只看均值会漏掉局部问题建议均值 最低分段一起看。B 因子 ≠ 实验 B 因子AlphaFold 输出的 PDB 里 B 因子列就是 pLDDT实验结构的 B 因子是原子位移参数两者含义不同别混用。pLDDT 低 ≠ 预测错蛋白本身无序或高柔性的区域模型也会标低置信属正常现象可结合 PAE 与文献中的无序区数据库交叉判断。指标会随版本演进细节以项目最新文档与 docs/technical_note_v2.3.0.md 为准。下一步行动清单拿到预测结果先打开confidence_model.json和pae_model.json把逐残基与逐残基对两个视角对照读一遍。单链 pLDDT 均值 70 时先回头检查 MSA 的序列覆盖再决定是否重跑或换数据库。复合物不要只看 pLDDTipTM 与 PAE 非对角块才是亚基相对取向可信度的依据。把低置信残基标出来与功能域文献或无序区预测交叉比对区分真实柔性与模型不确定。需要自动化时直接用confidence_json里的confidenceCategory字段D/L/M/H做阈值筛选避免自己切分数。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考