十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AlphaFold:从一条序列预测蛋白质结构的实战手册

AlphaFold:从一条序列预测蛋白质结构的实战手册 AlphaFold从一条序列预测蛋白质结构的实战手册【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold用 X 射线晶体学拿到一个蛋白质结构要等几周甚至几个月AlphaFold 让这件事在几小时内完成。AlphaFold 是 Google DeepMind 开源的人工智能蛋白质结构预测实现你输入一份含蛋白质序列的 FASTA 文件它输出原子级的 3D 结构并附带逐残基的置信度评分。跑通 AlphaFold 的 Docker 安装流程完成第一次单体结构预测用 multimer 预设预测蛋白质复合物结构看懂 pLDDT、pTM、PAE 三个指标判断预测结果靠不靠谱⚡ AlphaFold 项目速览与核心亮点AlphaFold 出自 Google DeepMind在 CASP14 蛋白质结构预测竞赛获胜后首次开源仓库同时包含推理管线和 AlphaFold-Multimer 复合物模型。代码采用 Apache 2.0 许可模型参数采用 CC BY 4.0 许可。接近实验精度CASP14 竞赛中达到与实验方法相当的准确率⚡ 推理快A100 上 100 残基约 5 秒2000 残基约 7.5 分钟双模式预设monomer单链与 multimer复合物一键切换置信度体系完整pLDDT、pTM、PAE 随结构一起输出v2.3.0 新权重大型复合物预测精度显著提升AlphaFold 工作原理与核心概念AlphaFold 精度的关键来自多序列比对MSAMultiple Sequence Alignment。你输入一条序列后它先用 JackHMMER、HHblits 等工具搜索 BFD、UniRef 等大型遗传数据库找出目标蛋白的同源序列并对齐成 MSA。MSA 里隐藏的序列保守模式给神经网络提供了远超单条序列本身的信息。第二个概念是结构和置信度同时输出。神经网络在预测 3D 结构的同时为每个残基给出一个置信分区域越可预测分数越高。你可以直接据此判断哪些部分可信而不是拿到一个黑盒结构。完整管线一次前向走下来FASTA 文件 → 构建 MSA 并搜索模板结构alphafold/data/pipeline.py→ 神经网络推理生成结构alphafold/model/model.py→ Amber 力场松弛优化局部几何 → 输出按置信度排序的结构。整条流程的入口是 run_alphafold.pyDocker 方式通过 docker/run_docker.py 调用。AlphaFold 安装与运行环境搭建与首次预测AlphaFold 仅支持 Linux且需要 NVIDIA GPU。资源需求如下项目要求操作系统Linux不支持 Windows / macOSGPU现代 NVIDIA GPU显存越大能预测的蛋白越大CPU / 内存最低 8 vCPU / 16 GB推荐 12 vCPU / 85 GB磁盘完整数据库解压后 2.62 TB精简版 600 GB开始前请先装好 Docker 和 NVIDIA Container Toolkit用于 GPU 支持并配置非 root 用户运行 Docker 的权限。克隆仓库并进入目录。git clone https://gitcode.com/GitHub_Trending/al/alphafold cd ./alphafold下载遗传数据库和模型参数下载量 556 GB、解压后 2.62 TB建议放后台执行且目录不能放在仓库内。scripts/download_all_data.sh DOWNLOAD_DIR download.log 2 download_all.log 验证容器能调用 GPU输出应列出你的显卡。docker run --rm --gpus all nvidia/cuda:11.0-base nvidia-smi构建 Docker 镜像并安装 run_docker.py 的依赖。docker build -f docker/Dockerfile -t alphafold . pip3 install -r docker/requirements.txt指向你的 FASTA 文件跑通第一次预测。python3 docker/run_docker.py \ --fasta_pathsyour_protein.fasta \ --max_template_date2022-01-01 \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/output--max_template_date限制模板结构的搜索截止日期复现历史测试集时很重要。跑完后输出目录里会出现ranked_0.pdb它就是置信度最高的结构直接拖进 PyMOL 或 ChimeraX 就能看。AlphaFold 进阶用法典型场景与参数选择单体预测单链蛋白的默认姿势绝大多数单链蛋白直接用默认预设 monomer 即可。python3 docker/run_docker.py \ --fasta_pathsmonomer.fasta \ --max_template_date2021-11-01 \ --model_presetmonomer \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/output需要复现 CASP14 配置时改用--model_presetmonomer_casp14但计算量是 8 倍平均精度只多 0.1 GDT日常使用不划算。多聚体预测预测蛋白质复合物结构复合物预测multimer把多条序列写进同一个 FASTA同源多聚体就重复写同一条序列即可。当前 v2.3.0 默认使用新微调的权重训练数据截止 2021-09-30约多 30% 数据其中大型结构翻倍训练链数从 8 提到 203/5 个模型的 MSA 序列上限从 1,152 提到 2,048大型复合物精度明显更好。注意 multimer 需要 UniProt 数据库已下载。python3 docker/run_docker.py \ --fasta_pathsmultimer.fasta \ --model_presetmultimer \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/output默认每个模型跑 5 个随机种子、共 25 个预测耗时较长想快速拿结果可以加--num_multimer_predictions_per_model1降到每模型 1 个种子。reduced_dbs 精简档资源有限时跑 AlphaFold磁盘和内存不够时切换到精简版遗传数据库用 small BFD 代替完整 BFD。先按精简档重新下载数据运行时加上对应预设。scripts/download_all_data.sh DOWNLOAD_DIR reduced_dbspython3 docker/run_docker.py \ --fasta_pathsmonomer.fasta \ --db_presetreduced_dbs \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/outputreduced_dbs 只需 8 vCPU、8 GB 内存和 600 GB 磁盘下载阶段和运行阶段的预设必须一致。结构阶段的参考速度A100不含 MSA 与模板搜索残基数预测耗时秒1004.9500291,000962,0004505,00018,824 AlphaFold 输出结果怎么看质量怎么判断每个目标蛋白在输出目录下生成一个独立子目录主要文件ranked_0.pdb置信度最高的结构unrelaxed_model_*.pdb模型原始输出relaxed_model_*.pdbAmber 松弛后的结构result_model_*.pklpLDDT / pTM / PAE 原始数据ranking_debug.json模型排序与分数明细relax_metrics.json松弛后的违反度指标timings.json各阶段耗时msas/MSA 命中文件判断质量看三个核心指标pLDDT预测局部距离差测试分0-100逐残基越高越可信同时写进 PDB 的 B-factor 列pTM预测 TM 分数整体打包置信度仅monomer_ptm和multimer模型输出PAE预测对齐误差N×N 矩阵反映残基对之间的相对位置误差用来识别柔性区域和复合物界面可操作的判断标准全序列平均 pLDDT 高于 80 时整体结构通常可靠低于 50 的区域多为无序或低置信关键功能区域落在这个区间时建议换多个种子重跑或结合实验数据交叉验证。另外注意 pLDDT 存于 B-factor 列但方向相反越高越好做分子置换前要小心处理。上图中 AlphaFold 在两个 CASP14 目标上的预测结构与实验结构几乎重合GDT 分别达到 90.7 和 93.3这也是高 pLDDT 区间可放心使用这一经验最直接的注脚。AlphaFold 常见问题与排错容器里用不了 GPUdocker run --gpus all nvidia/cuda:11.0-base nvidia-smi列不出显卡基本是 NVIDIA Container Toolkit 没装好或没生效重装该工具并重启 Docker 服务。磁盘装不下 2.62 TB 数据库改走 reduced_dbs 精简档下载时执行scripts/download_all_data.sh DOWNLOAD_DIR reduced_dbs运行时加--db_presetreduced_dbs600 GB 磁盘、8 GB 内存即可跑。Docker 构建特别慢下载目录放在仓库里导致数据库被拷进镜像构建上下文把数据目录挪到仓库外再重新构建。MSA 阶段报莫名其妙的错误多数是数据库目录的读写权限问题用sudo chmod 755 -R $DOWNLOAD_DIR修复权限后重试。松弛阶段崩溃或太慢先用--models_to_relaxnone跳过松弛直接拿结构或加--enable_gpu_relaxfalse把松弛换到 CPU 上跑GPU 松弛更快但稳定性略差。总结与延伸阅读AlphaFold 把从序列到结构从耗时数月的实验流程变成一台机器几小时内跑完的管线输入 FASTA得到按置信度排序的结构和逐残基评分。Docker 化的部署、单体/复合物双预设、内置的置信度指标使它成为蛋白质结构预测领域落地最顺手的工具之一。跑通单体后建议试一下 multimer 预设预测一个同源二聚体用 PAE 检查界面区域对同一条序列反复调参时加上--use_precomputed_msastrue复用已算好的 MSA能省掉最大的那部分耗时。v2.3.0 的训练数据与推理配置细节可阅读官方技术说明 docs/technical_note_v2.3.0.md。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表