拓冰建站拓冰建站
首页 / 资讯中心 / 正文

AlphaFold蛋白质结构预测:三步拿到结构

AlphaFold蛋白质结构预测三步拿到结构【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold你拿到一条蛋白序列晶体迟迟养不出来实验设计却在等结构数据卡住。AlphaFold 就是为此而生的开源蛋白质结构预测流水线输入一份 FASTA 序列它替你检索进化同源序列、跑深度学习网络最后输出带原子坐标和逐残基置信度的三维结构。AlphaFold蛋白质结构预测结果蓝色与实验结构绿色对比CASP14 两个靶标 GDT 分别为 90.7 和 93.3 开工清单先搞懂4个核心概念跑命令之前4 个概念足够多序列比对MSA好比通过亲戚的照片推断一个人的长相。AlphaFold 先在序列数据库里搜目标蛋白的同源序列并对齐网络主要靠这些进化约束推结构。模板可参考的已有实验结构。模板检索基于 PDB70--max_template_date限定模板可用的截止日期。pLDDT每个残基的预测置信度0–100越高越好。它存在 PDB 的 B-factor 列里注意与常规 B-factor 含义相反数值越高越可信。能量弛豫relax预测后用 Amber 力场修正不合理的几何。默认只精修置信度最高的一个模型--models_to_relaxbest。还有个事实要知道AlphaFold 默认跑 5 个模型按置信度选出最佳结果就是ranked_0.pdb。 快速上手三步命令跑通第一次预测官方推荐的环境配置是 Docker仅支持 Linux并需要一块 NVIDIA GPU。第一步拉代码、建镜像git clone https://gitcode.com/GitHub_Trending/al/alphafold cd alphafold docker build -f docker/Dockerfile -t alphafold .第一条取代码最后一条构建运行镜像执行前确认已装好 Docker 和 NVIDIA Container Toolkit。第二步一键下载序列数据库与模型参数scripts/download_all_data.sh /data/alphafold_db download.log 2 download_all.log 完整数据库下载 556 GB、解压后约 2.62 TB建议放 SSD 并挂后台跑。资源有限就给命令末尾加reduced_dbs8 vCPU、8 GB 内存、600 GB 磁盘即可运行预测时记得配套传--db_presetreduced_dbs。下载目录务必放在代码仓库之外否则镜像构建会慢很多。第三步跑预测python3 docker/run_docker.py \ --fasta_pathsyour_protein.fasta \ --max_template_date2022-01-01 \ --data_dir/data/alphafold_db \ --output_dir/data/output--fasta_paths指向你的序列文件--output_dir必须写绝对路径结束后结果就在输出目录下以 FASTA 文件名命名的子目录里。 结果分析30秒自检预测置信度跑完后打开以靶标命名的子目录ranked_0.pdb就是排名最高的结构。30 秒做 4 项核对总体水平ranking_debug.json记录每个模型用于排名的分数单链是 pLDDT多链是 iPTM/pTM。最佳模型平均置信度 ≥70 才值得细看普遍 50 基本不可靠。逐残基confidence_model_*.json把每个残基分为 D(50常为无序区)、L(50–70)、M(70–90)、H(90–100) 四档把 H 和 M 区域当作结构依据最稳妥。域间关系pae_model_*.json给出 PAE 矩阵单位埃0 表示最可信仅 pTM 或多链模型输出。非对角区块数值高说明这两个结构域或链的相对位置别信。几何质量relax_metrics.json里的remaining_violations是弛豫后残留的立体化学冲突数数值小弛豫后的结构就可以放心用于下游。 真实案例走查一条200残基的酶拿一条 200 残基的酶做例子FASTA 只有两行test_enzyme MKTAYIAKQRQISFVKSHFSRNGQHEAMVRDLLTR接着把第三步命令里的--fasta_paths换成test_enzyme.fasta执行即可。耗时参考单张 A100 官方实测不含 MSA 检索与弛豫100 残基约 5 秒200 残基约 8 秒500 残基约 29 秒加--benchmarktrue可在timings.json看到分段计时。输出包含 5 套 unrelaxed/relaxed/ranked PDB外加msas/目录——里面存着序列检索的原始比对对齐深度浅时它是结果不佳的第一个排查对象。解读上如果 ranked_0 整体 pLDDT 在 90 以上骨架可直接拿去对接若只有部分残基落在 H 档其余很可能是无序区域别去过度解释那些环区。❓ 进阶快问快答蛋白质三维构象抽象可视化展示α-螺旋与β-折叠二级结构的排布问怎么预测蛋白复合物包括同源二聚体把多条链写进同一个 FASTA加--model_presetmultimer并且需要 UniProt 数据库。默认每个模型跑 5 个随机种子共 25 次预测赶时间可设--num_multimer_predictions_per_model1精度略有下降。问突变影响怎么分析在 FASTA 里把突变位点换成目标氨基酸重新预测再把两个结构叠合看局部变化。--use_precomputed_msastrue只适用于同序列换参数重跑序列变了MSA 必须重跑。问能直接找药物结合口袋吗不能。输出是静态结构口袋识别和分子对接要交给其他工具可以优先看 pLDDT≥70 的表面区域。另注意官方声明结果仅用于理论建模不用于临床或医学用途。问大蛋白跑多久官方 A100 实测1000 残基约 96 秒2000 残基约 450 秒4000 残基约 1.6 小时均不含 MSA 与弛豫。显存决定可预测的序列长度上限显存更大的 GPU 能跑更大的蛋白。 下一步资源清单与适用性判断速度表与全部参数说明README.md 的 AlphaFold prediction speed 一节v2.3.0 模型与推理细节docs/technical_note_v2.3.0.mdCASP15 基线预测集含人工干预说明docs/casp15_predictions.zip无本地 GPU 试用notebooks/AlphaFold.ipynb数据下载脚本scripts/推理主入口 run_alphafold.py模型配置 alphafold/model/config.py一句话适用性判断你要从一条序列拿到高置信度的静态结构、且该蛋白有进化同源序列可参考它就是当前该用的工具想研究构象动态或结合亲和力数值不在这个范围里。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门