十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AlphaFold 结构预测可信吗?用 4 个指标快速做一轮质量控制体检

AlphaFold 结构预测可信吗?用 4 个指标快速做一轮质量控制体检 AlphaFold 结构预测可信吗用 4 个指标快速做一轮质量控制体检【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafoldAlphaFold 结构预测跑完后先别急着盯丝带图要看质量控制指标。pLDDT、PAE、pTM、ipTM 这四个数共同决定预测结构可信度这篇文章带你把它们逐个读明白。如何判断 AlphaFold 预测可靠一张质量体检表拿到预测结果先看这 4 个数字全部健康结构可以放心用任何一项亮红灯你都要知道问题出在哪一级。四个指标各管一摊职责不重叠指标衡量什么取值范围一眼怎么读什么信号要警惕pLDDT单个残基局部位置的可信程度0–100分数越高该残基越可靠逐残基画曲线关键功能区落在 50 分以下PAE一对残基相对位置的预测误差单位 Å热图越暗越好看对角线外的块两个结构域之间的块明显偏亮pTM整体折叠的可靠性0–1单一数值越接近 1 越好低于 0.5整体折叠存疑ipTM复合物中不同链之间的界面质量0–1越高说明链间结合越可信pTM 高但 ipTM 低结合可能不成立四者的分工可以这么记pLDDT 是逐残基的打分卡PAE 是一张区域间关系可信度地图pTM 和 ipTM 则分别给整体和界面各打一个总分。对应实现都在 alphafold/common/confidence.py 里compute_plddt算 pLDDTcompute_predicted_aligned_error算 PAEpredicted_tm_score算 pTM 和 ipTM。pLDDT 分数怎么看D/L/M/H 四档行动指南pLDDT 的取值不是拍脑袋分的源码里对每个残基的 logits 做 softmax 后按 bin 中心加权平均再乘 100 落到 0–100 分def compute_plddt(logits: np.ndarray) - np.ndarray: num_bins logits.shape[-1] bin_width 1.0 / num_bins bin_centers np.arange(start0.5 * bin_width, stop1.0, stepbin_width) probs scipy.special.softmax(logits, axis-1) predicted_lddt_ca np.sum(probs * bin_centers[None, :], axis-1) return predicted_lddt_ca * 100模型输出的不是一串分数而是一段区间上的概率分布pLDDT 就是这段分布的期望值。拿到分数后按下面四档对照源码里的分档逻辑决定动作def _confidence_category(score: float) - str: if 0 score 50: return D if 50 score 70: return L elif 70 score 90: return M elif 90 score 100: return HD 档0–50大概率是内在无序区模型自己也在打赌。做法把这段序列从下游任务里剔出去如果你的课题就是 IDP可以拿它当无序区证据但别拿坐标做任何几何计算。L 档50–70结构可能有较大偏差尤其常见于 loop 和链端。做法只把它当整体走向参考别在这段上做精确的残基级判断回头核对 PAE 热图里对应位置是否也偏亮。M 档70–90二级结构层面的走向可信原子级细节可能偏。做法可以做功能区域定位、结构域划分这类中等精度任务涉及结合口袋关键残基时建议用实验数据或对接打分再交叉验证。H 档90–100模型最有把握的部分。做法分子对接、突变位点挑选、结合位点识别优先放在这里论文里引用的关键残基坐标尽量都出自 H 档区域。一个实用习惯把 pLDDT 曲线和已知的活性位点序列号叠在一起看。关键残基落在哪一档直接决定了这个预测对下游任务的可用深度。PAE 热图解读三步走先看对角线再看跨区域块PAE 回答的问题是把两个残基对所在的局部对齐后它们之间的距离平均会偏多少单位 Å。它不关心单个残基绝对位置只关心这两处相对摆对了吗。热图横轴纵轴都是残基序号颜色代表每对残基的预测对齐误差数值越低越可信。按下面三步读第一步扫对角线。沿主对角线的一条暗带说明局部折叠可靠——相邻和近邻残基的相对位置都没问题。如果对角线上出现某一段突然变亮那一段的局部结构本身就不可信先去查它的 pLDDT 是不是也掉档了。第二步看对角线外的块。假设残基 10–60 和 120–170 是两个结构域就看热图上对应行区间 × 列区间交叉出来的那块区域。颜色深误差小 这两个域的相对取向可靠你画的域间界面和相对位置可以放心用颜色浅误差大 两个域各自折叠没问题但它们之间的夹角和距离是模型猜的。第三步看整图颜色分布。全图整体偏暗说明这是个高置信目标整体偏亮说明大面积区域间关系都不可靠结论要降级到单体折叠层面。还有一类信号值得单独记整图对称位置的颜色差异——PAE 矩阵本身近似对称如果某块区域显著偏亮且只在矩阵某一侧出现多半对应该区域存在构象异质性比如柔性接头连接的域。三步走完你可以对任何一段域 A 相对域 B 朝向如何的断言说出PAE 上对应块均值是 X Å可靠/不可靠这种有据可查的判断而不是凭丝带图观感。复合物才需要的两个数pTM 看全局ipTM 看界面单链预测只需要 pLDDT 和 PAE一旦是多链复合物pTM 和 ipTM 就成了必须记录的两个总分两者都在 0–1 之间。pTM预测 TM 分数评估整个预测结构与真实结构在整体拓扑上的一致性数值越接近 1 越好。它和平均 pLDDT的区别在于平均 pLDDT 只看局部残基各自稳不稳pTM 会把全局几何误差一起算进去——一条链局部都高置信、但整体摆错形状的复合物平均 pLDDT 可能很高pTM 却上不去。所以看复合物整体优先看 pTM 而不是 pLDDT 均值。ipTM界面 pTM只在不同链之间的残基对上计算源码里用asym_id把跨链残基对 mask 出来专门回答一个问题这两条链贴在一起这个界面可信吗。ipTM 高说明链间接触界面的相对位置预测靠谱ipTM 低即使每条链单体折叠都漂亮这个复合物构象也不该直接用于界面突变或对接研究。组合起来读常见三种情形pTM 高 ipTM 高复合物整体和界面都可信放心用pTM 高 ipTM 低每条链各自折叠没问题但结合方式可疑先查文献确认该复合体是否真实存在pTM 低整体折叠都有问题先怀疑输入序列、链组成、化学计量比而不是纠结指标本身。指标是模型给的但模型有多可靠取决于你怎么跑同样一条序列运行参数不同输出的置信度指标稳定性可以差很多。跑之前确认三件事输入序列质量。序列要完整、准确截断或缺失的序列会让 MSA 检索质量下降间接拉低 pLDDT。复合物场景下更要保证链的顺序和化学计量比正确——ipTM 的计算直接依赖asym_id的链划分链给错了界面指标无从谈起。seed 数量。run_alphafold.py默认每个模型 5 个 seed多 seed 跑出的结果取置信度最高的那个。官方技术笔记明确建议对非常大或困难的目标把 seed 提到 20代价是计算时间成倍增加普通目标没必要。recycling 次数。默认回收 3 次把上一轮的结构信息回喂进模型再预测。技术笔记中 CASP15 基线把上限提到了 20 次并配合早停对顽固目标同样可以适当加。加 seed 和加 recycling 都只影响难目标的收益别为了保险无脑拉满。另外一句带过v2.3.0 换上了新训练截止日2021-09-30的 AlphaFold-Multimer 权重训练数据里大复合物和冷冻电镜结构占比大幅提高见 docs/technical_note_v2.3.0.md大型复合物的预测准确性相比旧版权重有明显提升跑复合物优先用新版。常见误判场景4 个容易踩的坑Q1pLDDT 大片低于 50是不是预测失败了不一定。D 档最常见的对应就是内在无序区实验结构X-ray/EM里这类区域往往同样没有电子密度。先拿序列查一下无序区数据库或文献确认是模型没猜对还是这个蛋白本来就没结构两者结论完全不同。Q2pLDDT 全线很高还能信吗不能只看 pLDDT。它只保证局部残基各自摆得稳两个域之间的相对取向完全可能不可靠。必须翻 PAE 热图看跨区域块——对角线暗、交叉块亮是典型的每个域都对、但域间关系是猜的结构。Q3预测结构和实验结构叠不上听谁的先看叠不上区域的 pLDDT如果落在 H 档却对不上实验说明这条预测结果确实不能信考虑加 seed、加 recycling 重跑或检查输入序列是否与实验品系一致如果落在 D/L 档那多半是模型诚实地区分出了低置信区以实验结构为准即可。上图是两个 CASP14 目标中预测蓝与实验绿结构的叠加下方 GDT 分数就是预测和实验到底像不像的直接量尺——它和 pLDDT 的差别在于GDT 需要实验结构对照而 pLDDT/PAE 在预测阶段就能给出这正是做质量控制时你最常依赖它们的原因。Q4单链 pTM 很高复合物 ipTM 却很低复合物到底有没有模型在说每条链的折叠我有把握但它们贴在一起这件事我没把握。这既可能是真实的弱结合或瞬态相互作用也可能是这个复合体根本不成立。先查文献和数据库里的结合证据再决定是补实验还是放弃该复合物假设。收个尾交付报告前的 5 步自查清单画 pLDDT 逐残基曲线标出 D/L/M/H 边界确认你的关键功能残基落在哪一档。打开 PAE 热图按对角线 → 跨区域块 → 整图分布三步过一遍对每个域间关系断言都能报出对应块的大致误差。复合物额外记录 pTM 和 ipTM按pTM 高 ipTM 低 界面可疑的规则做一轮筛查。把预测结果与已知同源结构或实验数据比对一次不一致区域回查 pLDDT 分档。结论涉及关键位点时用更多 seed 或更高 recycling 重跑一遍确认指标稳定再写入报告。深入源码alphafold/common/confidence.pypLDDT、PAE、pTM/ipTM 四个指标的全部计算实现compute_plddt、compute_predicted_aligned_error、predicted_tm_score是核心入口。alphafold/model/lddt.pyLDDT 损失与预测头相关的模型侧实现理解模型为什么能输出置信度从这里入手。docs/technical_note_v2.3.0.mdv2.3.0 的训练数据更新与推荐推理参数seed 数、recycling 上限的官方说明。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表