十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

用AlphaFold-Multimer把一条多链FASTA跑成蛋白复合物结构

用AlphaFold-Multimer把一条多链FASTA跑成蛋白复合物结构 用AlphaFold-Multimer把一条多链FASTA跑成蛋白复合物结构【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold本文跑通 AlphaFold-Multimer 多聚体预测最短路径一份多链 FASTA、一条 docker 命令输出目录直接得到复合物结构 ranked_0.pdb。第一次折叠多亚基复合物通常会卡在这三处结构组刚用交联质谱确认了一个五亚基复合物的组成下一步就是让 AlphaFold-Multimer 给出三维结构但第一次上手普遍卡在三个地方FASTA 里多条链的条目怎么写、运行前要下载哪些数据库、两三千残基的复合物为什么跑得特别慢。下文用官方 Docker 管线走一遍最小可用的多聚体预测并解释 v2.3.0 多聚体模型改了什么、输出文件怎么读。仓库当前代码版本为 v2.3.2见 alphafold/version.py安装与参数说明以 README.md 为准。三步跑通第一条AlphaFold-Multimer多聚体预测前置条件是 Linux、Docker 与 NVIDIA Container Toolkit。拉取仓库git clone https://gitcode.com/GitHub_Trending/al/alphafold进入目录后做三件事下载数据库与模型参数。首次跑通建议用小数据库省时间bash scripts/download_all_data.sh $DOWNLOAD_DIR reduced_dbs约600GB追求精度再换全量下载556GB、解压后2.62TB。构建镜像docker build -f docker/Dockerfile -t alphafold .并执行pip3 install -r docker/requirements.txt。准备输入并运行。FASTA 文件里每个条目是一条链下面用两条同序列做格式演示实际请放完整序列sequence_1 MALWMRLLPLLALLALWGPDPAAAFVNQHLCGSHLVEALYLVCGERGFFYTPKTRREA sequence_2 MALWMRLLPLLALLALWGPDPAAAFVNQHLCGSHLVEALYLVCGERGFFYTPKTRREA核心命令只需这五个参数python3 docker/run_docker.py \ --fasta_pathsdim.fasta \ --max_template_date2022-01-01 \ --model_presetmultimer \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/output跑完后检查输出目录下dim/ranked_0.pdb是否存在存在即跑通。多聚体模式额外依赖 UniProt 与 PDB seqres 两个数据库scripts/download_all_data.sh已一并处理。v2.3.0多聚体模型给大型复合物改了什么先看管线全貌FASTA 进入 MSA 与模板搜索JackHMMER、HHblits、HHsearch 等工具位于 alphafold/data/tools/随后 EVOformer 生成残基与成对表征多聚体模式下成对表征覆盖所有链链间接触被显式建模Structure Module 输出坐标并 recycle 多轮最后 5 个模型各跑 N 个随机种子按 pLDDT 排序后做 Amber 松弛。模型配置在 alphafold/model/config.py多聚体前向流程见 alphafold/model/folding_multimer.py。v2.3.0 与上一代 v2.2 的差异全部来自训练数据与上限架构和训练方法没有变化项目v2.2v2.3.0训练数据截止2018-04-302021-09-30约多30%数据冷冻电镜结构数量基准4倍超过2000残基的大结构基准2倍训练裁剪大小384残基640残基训练最大链数820单模型MSA序列上限115220485个模型中的3个官方结论化学计量已知时优先使用新版多聚体模型即使目标是已知单体的复合物非常大或困难的靶点建议每模型 20 个种子CASP15 基线设置默认值仍是 5。依据见 docs/technical_note_v2.3.0.md。A100硬件门槛与关键参数默认值速查官方在 12 vCPU、85GB RAM、100GB 系统盘加 3TB 数据库盘、单卡 A100 的机器上验证过完整流程。关键参数的默认值与推荐值集中在下表默认值可在 docker/run_docker.py 的 flag 定义里逐一核对参数默认值推荐值说明与硬件要求--db_presetfull_dbs首次跑用 reduced_dbsreduced 需 8核/8GB RAM/600GB 盘full 下载556GB、解压2.62TB--model_presetmonomermultimermultimer 额外挂载 UniProt 与 pdb_seqres--num_multimer_predictions_per_model5共25次预测快速用1大复合2020 仅用于非常大或困难的靶点--models_to_relaxbestbestnone 可整体跳过松弛--enable_gpu_relaxtrue大复合改 falseGPU 松弛快但稳定性差--use_precomputed_msasfalse同序列重跑改 true要求 output_dir 不变global_config.subbatch_size4按显存调节A100 上小结构调大更快显存不足调小A100 上的纯结构生成耗时不含 MSA 与模板搜索、3 次 recycle100 残基 4.9 秒、500 残基 29 秒、1000 残基 96 秒、2000 残基 450 秒、5000 残基 18824 秒。⚠️ 数据库目录不要放在仓库目录内否则整个库会进入 Docker 构建上下文docker/run_docker.py对此有直接报错检查。从multimer.fasta到ranked_0.pdb的输入输出全链路输入端只有一种格式FASTA条目顺序即化学计量A2B3 复合物就写 5 个条目前两个 A、后三个 B多个文件用逗号分隔会依次折叠。输出端结构如下输入 dim.fasta2条序列上方命令 └─ dim/ ├─ ranked_0.pdb # pLDDT最高默认仅它被松弛 ├─ unrelaxed_model_1..5.pdb # 5个模型的原始结构 ├─ relaxed_model_1..5.pdb / result_model_1..5.pkl ├─ result_model_1..5.pkl # pLDDT、pTM、PAE矩阵 └─ msas/ ranking/relax/timings.json读结果时把握三个要点ranked_0.pdb 按 pLDDT 排序pLDDT 同时写进了 PDB 的 B-factor 字段注意它值越大越好与晶体学惯例相反做分子置换时要小心pTM 是整体组装的全局指标PAEpredicted_aligned_error是残基对矩阵跨链块的值低才说明该界面的相对位置可信。完整文件清单以 README.md 的 AlphaFold output 一节为准。多聚体预测四个高频坑根因与处理⚠️ 以下四项按出现频率排序参数语义均可对照 docker/run_docker.py 的 flag 定义处理。MSA 阶段崩溃且报错信息不透明。根因是下载目录缺读写权限MSA 工具会把权限问题包装成长段外部报错。处理sudo chmod 755 --recursive $DOWNLOAD_DIRREADME 对此有专门提示。两千残基以上的复合物在结构生成阶段 OOM。根因是序列长度与 MSA 深度叠加后显存爆炸。处理三选一--db_presetreduced_dbs降低 MSA 规模、把 alphafold/model/config.py 中global_config.subbatch_size默认4调小、或先用 monomer 模型把各链单独折叠以定位问题。五链组装与已知化学计量不符或界面错位。根因是随机种子偏少或 FASTA 条目顺序与已知组装不一致。处理--num_multimer_predictions_per_model20并把条目顺序对齐已知复合物CASP15 基线对大靶点正是 20 种子。松弛步骤报错或 relax_metrics.json 残留违规很多。根因是 GPU 松弛速度快但稳定性差。处理--enable_gpu_relaxfalse改 CPU 松弛或--models_to_relaxnone跳过松弛直接看 unrelaxed_model_*.pdb 排查。没有实验结构时如何自检预测复合物可信度最直接的验证是带约束的重预测把--max_template_date设到实验结构 PDB 发布日期之前让模型无法把它当模板然后把 ranked_0.pdb 与实验结构叠加计算 GDT 或 TM-score仓库自带 docs/casp15_predictions.zip 的 CASP15 基线预测可直接对比复现流程。没有实验结构时做三项自检取 result_model_*.pkl 的 PAE 矩阵看跨链块值低的界面才可信pTM 偏低说明全局组装存疑逐残基 pLDDT 低于 50 的区域按无序区处理不要据此推断界面。延伸资源安装与参数全表 README.md、模型更新说明 docs/technical_note_v2.3.0.md、数据库脚本 scripts/download_all_data.sh 与参数脚本 scripts/download_alphafold_params.sh、交互演示 notebooks/AlphaFold.ipynb。也可以把预测序列提交到 AlphaFold Protein Structure Database用已发布的预测做旁证。把第二条命令贴进终端从 dim.fasta 到 ranked_0.pdb 跑通你的第一次多亚基预测。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表