
AlphaFold蛋白质结构预测实战指南从单链FASTA到5000残基复合物的可信模型【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold拿到两条候选互作蛋白的序列却不知道它们在三维空间里如何拼在一起这篇文章带你完整走一遍 AlphaFold 蛋白质结构预测先用单链 FASTA 跑出可靠的单体结构再用 AlphaFold-Multimer 预测复合物结构最后看懂 pLDDT 和 PAE 告诉你哪些界面可信。动手前选数据库预设与预估预测耗时这章解决开始预测前磁盘要留多大、要等多久。AlphaFold 只支持 Linux需要 Docker NVIDIA GPUGPU 显存越大能预测的结构越大。官方推荐的测试配置是 12 vCPU、85 GB 内存加一张 A100。运行前用docker run --rm --gpus all nvidia/cuda:11.0-base nvidia-smi确认 GPU 可见。遗传数据库决定 MSA多序列比对可理解为把 BFD、UniRef、MGnify 等多个来源的同源序列汇总成一份进化证据的搜索质量官方提供两种预设参数数据量硬件需求适用场景--db_presetreduced_dbs解压后约 600 GB8 CPU 核心、8 GB 内存快速测试、中小型蛋白--db_presetfull_dbs下载 556 GB解压后 2.62 TB建议 12 vCPU、32 GB 内存以上SSD高精度预测、大型复合物两者都通过 scripts/download_all_data.sh 下载reduced 版加reduced_dbs参数。注意下载目录别放在仓库内部否则 Docker 构建会因复制大文件而变慢。耗时参考单张 A100不含 MSA 与模板搜索不松弛、3 次 recycle残基数预测时间1004.9 秒50029 秒100096 秒2000约 7.5 分钟3000约 21 分钟5000约 5.2 小时硬件建议中小蛋白一张主流 GPU 就够超过 2000 残基请上 A100 级别磁盘一定用 SSD否则 MSA 搜索会成为瓶颈。✅ 本章完成标准nvidia-smi能看到 GPU数据库下载完磁盘剩余空间大于预设所需。第一枪跑通单体预测这章解决用最短路径拿到第一个结构文件。准备一个最小 FASTA序列截短示意用你的真实序列sequence_name MALWMRLLPLLALLALWGPDPAAAFVNQHLCGSHLVEALYLVCGER然后一条命令跑起来python3 docker/run_docker.py \ --fasta_pathsmonomer.fasta \ --max_template_date2022-01-01 \ # 只用该日期前的结构做模板 --model_presetmonomer \ --db_presetreduced_dbs \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/output⚡ 官方完整参数说明见 docker/run_docker.py 与 README.md。跑完后输出目录output_dir/target_name/里有这些关键文件文件是什么你要看什么ranked_0.pdb5 个模型按 pLDDT 排序后的第一名默认已松弛你实际要用的结构pLDDT 存在 B-factor 列越大越好ranking_debug.json各模型的 pLDDT 打分及模型名映射最佳模型与其余模型的差距判断结果稳不稳result_model_*.pkl模型原始输出numpy 数组plddt逐残基置信度pTM 模型还含ptm标量与 PAE 矩阵relaxed_model_*.pdbAmber 松弛后的结构局部几何是否合理unrelaxed_model_*.pdb模型直接输出的结构与松弛版对比看松弛改了多少relax_metrics.json松弛后剩余结构违规数数值应很小timings.json各阶段耗时时间花在哪一步msas/各数据库的比对结果同源序列够不够多直接影响置信度✅ 本章完成标准输出目录里能看到ranked_0.pdb和ranking_debug.json且 pLDDT 打分已写入。从一条链到多条链AlphaFold-Multimer 复合物预测这章解决两条或更多链如何拼成一个复合物模型。为什么单体模型不够。monomer 模型把每条链单独折叠无法表达链间相对位置与界面。如果你问这两条链结合吗、以什么姿态结合单体预测回答不了。多聚体multimer模型把所有链放进同一个系统建模并额外输出 PAE 矩阵——它的非对角区块直接量化链 A 的某残基相对链 B 某残基的位置误差是判断界面是否可信的直接证据。v2.3.0 多聚体模型的关键升级。技术笔记docs/technical_note_v2.3.0.md列出的改动训练数据截止日期2018-04-30 → 2021-09-30约多 30% 的结构数据冷冻电镜结构数量 4 倍2000 残基以上的大结构 2 倍训练裁剪crop大小384 → 640 残基训练时最大链数8 → 205 个模型中有 3 个的 MSA 序列上限1152 → 2048官方建议当复合物化学计量已知时包括已知的单体结构优先用这版 multimer 模型计量未知时如基因组规模预测单链模型平均更准除非该链达到数千残基。同源与异源多聚体的输入写法。规则只有一条每个亚基一个 FASTA 条目顺序与份数对照已知计量核对。# 同源三聚体同一序列复制 3 份 chain_a_1 MALWMRLLPLLALLALWGPDPAAAFVNQHLCGSHLVEALYLVCGER chain_a_2 MALWMRLLPLLALLALWGPDPAAAFVNQHLCGSHLVEALYLVCGER chain_a_3 MALWMRLLPLLALLALWGPDPAAAFVNQHLCGSHLVEALYLVCGER # 异源 A2B3A 链 2 份 B 链 3 份 chain_a_1 SEQUENCE A chain_a_2 SEQUENCE A chain_b_1 SEQUENCE B chain_b_2 SEQUENCE B chain_b_3 SEQUENCE B运行命令多聚体默认每个模型跑 5 个随机种子、5 个模型共 25 个预测再按置信度排序取最优python3 docker/run_docker.py \ --fasta_pathscomplex.fasta \ --max_template_date2022-01-01 \ --model_presetmultimer \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/complex_output注意 multimer 还需要 UniProt 与 PDB seqres 数据库full_dbs 下载脚本已包含。✅ 本章完成标准ranked_0.pdb里出现全部输入链且result_model_*.pkl中能从 PAE 矩阵读出链间区块。大型复合物预测稳定性调参这章解决超过 2000 残基时跑得动、跑得稳、跑得对。遇到什么情况调什么参数怎么调GPU 显存不足global_config.subbatch_sizealphafold/model/config.py调小模型逐层小批处理省显存README 提到 A100 上对小结构可反向调大以提速大目标结果波动大、跑一次不放心--num_multimer_predictions_per_model默认每模型 5 种子官方对非常大或困难的目标推荐加到 20CASP15 配置松弛步崩溃或几何异常--enable_gpu_relax设为false改用 CPU 松弛慢但稳定同一序列换参数反复实验--use_precomputed_msas设为true复用上次输出目录里的 MSA跳过数据库搜索要求序列不变决策建议一句话版先按默认跑通 → 显存爆了再降 subbatch → 大型目标结果不稳就把种子加到 20 → 松弛出错才切 CPU。不要一上来全开。✅ 本章完成标准大复合物完整跑完不中断timings.json显示各阶段正常结束。读懂预测结果pLDDT、pTM 与 PAE 矩阵解读这章解决拿到结构后怎么判断哪些部分能信、哪些不能。把一次预测想象成一份体检报告三个指标各管一段指标形态类比怎么读pLDDT每残基 0–100每个检查项目的单项数值90 稳定可信50–90 大致可靠50 基本不可信常对应无序区pTM单个标量整体合格/不合格结论评估整条链或整个复合物的全局折叠与亚基打包是否可信低分意味着全局结构都要打折看待PAEN×N 残基对矩阵两个器官的相对位置关系图值 该残基对相对位置的预测误差Å。对角区低链内可靠链间区块低两条链确实紧密结合链间区块高相对位置模型没把握注意两点默认 monomer 模型只输出 pLDDT存在 PDB 的 B-factor 列与常规 B-factor 方向相反越大越好pTM 和 PAE 需要 multimer 模型或--model_presetmonomer_ptm。多聚体预测的完整输出目录包含ranked_{0..4}.pdb、relaxed_model_{1..5}.pdb、result_model_{1..5}.pkl、features.pkl、ranking_debug.json、relax_metrics.json、timings.json与msas/逐一含义见本章前一张表的姊妹章节。上图是 CASP14 中 AlphaFold 预测蓝与实验结构红的重叠对比可以看到预测与实验结构在整体折叠上高度一致。可视化查看PyMOL 载入ranked_0.pdb后可按 B-factor 着色直观看到逐区域置信度ChimeraX 适合对比多个模型并出版级图在线的 AlphaFold Protein Structure Database 可把预测与实验结构并排比较。✅ 本章完成标准你能指着ranked_0.pdb说出哪个区段高置信、并解释一个界面在 PAE 链间区块里的表现。排错手册三类高频问题GPU 显存不足CUDA out of memory→ 显存占用由残基数与分批大小共同决定大目标默认参数可能直接溢出。解法1) 降低config.py中的global_config.subbatch_size2) 显式声明更大的 GPU官方建议按能装下的最大结构选卡3) 拆分复合体先按结构域分别预测单体再预测复合物。低置信度区域pLDDT 50→ 常见原因有三该区域是内在无序区IDR、MSA 在该区段同源证据不足、或该区域本身不存在唯一高置信构象。解法1) 打开msas/看该区段的比对覆盖2) 换--model_presetmonomer_ptm拿 PAE确认该区域相对其他结构域的位置是否仍稳定3) 报告中将该区段明确标注为低置信/无序而不是当作结构缺陷。亚基相对位置异常链间分离或朝向不合理→ 原因可能是随机种子方差默认每模型 5 种子大目标官方推荐 20、输入计量或链顺序与真实复合物不符、或模型参数过旧。解法1)--num_multimer_predictions_per_model20扩大样本再按 pLDDT/PAE 挑选2) 对照已知化学计量核对 FASTA 的链顺序与份数3) 用 scripts/download_alphafold_params.sh 更新模型参数4) 看 PAE 链间区块——如果那里也显示高误差说明模型认为该界面本就不稳定属预测如实反映了不确定性先回到文献核对复合物是否真实存在。⚠️ 排错顺序建议先查输入FASTA、计量→ 再查参数种子、subbatch→ 最后才怀疑模型本身。从一条 FASTA 到带置信度指标的复合物模型整条链路已经完整monomer 跑出基线结构multimer 给出链间组装pLDDT 与 PAE 划出可信边界。下一步动作现在就做挑你最关心的那两条序列写进一个 FASTA加上--model_presetmultimer跑一轮——哪怕这次置信度不高PAE 矩阵也已经告诉你哪些界面值得继续投入。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考