2026/8/29 18:18:15

课前准备--EGFR突变结构与药物设计

课前准备--EGFR突变结构与药物设计 作者Evil Genius今天我们梳理一个案例来看看分子对接分子动力学的实际运用。EGFR 是非常适合用来串联“基因突变 → 蛋白结构 → 构象变化 → 分子对接 → 分子动力学 → 药物设计 → 实验验证”的经典案例。一个完整的结构生物学/计算药物设计工作流EGFR突变 → 突变蛋白结构预测 → WT/Mut结构比较 → 突变造成的构象变化 → 找结合口袋 → 药物对接 → MD验证 → MM/PBSA/自由能 → 设计/筛选新抑制剂 → 实验验证下面以EGFR L858R、Exon 19 deletion、Exon 20 insertion为主线详细拆开。一、首先要明确EGFR到底是什么EGFREpidermal Growth Factor Receptor是一个受体酪氨酸激酶RTK。它大体可以分成胞外结构域 │ │ EGF结合 ↓ 跨膜区 │ ↓ 胞内酪氨酸激酶结构域 │ ↓ C-terminal tail │ ↓ 下游信号 RAS-RAF-MEK-ERK PI3K-AKT-mTOR STAT真正适合进行结构预测分子对接MD药物设计的核心是胞内 kinase domainKD。EGFR激酶结构域大约是残基 696–1022其中最重要的是N-lobe ├── β-sheet ├── ATP-binding pocket └── αC-helix ↓ ATP binding site ↓ C-lobe ├── catalytic loop ├── activation loop └── substrate binding regionEGFR 的许多致癌突变实际上就是改变这个 kinase domain 的构象平衡。二、EGFR最重要的几个突变如果你准备建立一个结构计算体系我建议至少比较类型突变外显子结构位置主要意义WTEGFR-WT——对照L858RLeu858→ArgExon 21activation loop激活突变Ex19del如 E746_A750delExon 19β3–αC loop激活突变Ex20ins如 D770_N771insNPGExon 20αC-helix附近激活TKI耐药T790MThr790→MetExon 20gatekeeper获得性耐药C797SCys797→SerExon 20ATP pocket三代TKI耐药这里尤其需要注意“19、20号外显子突变”不是一种突变。例如Exon 19最经典的是E746_A750del也就是WT: ...E746-L747-R748-E749-A750... Mutation: ... ΔELREA而 Exon 20 则包括很多不同的 insertion例如D770_N771insNPG它们虽然都叫 Exon 20 insertion但结构效应并不完全一样。三、为什么 L858R 会激活 EGFR这是整个 EGFR 结构生物学中非常经典的问题。L858 位于activation loopA-loop原本L858 Leucine突变L858R Leu → Arg也就是疏水氨基酸 ↓ 带正电的大侧链这不是简单的“一个氨基酸换掉了”。真正重要的是它改变了 EGFR kinase domain 的构象能量景观。1. WT EGFR存在 inactive ↔ active 平衡可以简单理解成┌──────────────┐ │ │ ↓ │ Inactive EGFR ⇄ Active EGFR │ ↓ ATP binding ↓ phosphorylation正常情况下inactive state 占比较大的比例。2. L858R把平衡推向active stateL858R改变activation loop附近的局部环境使inactive kinase构象不再那么稳定。结果WT Inactive ↑ │ │ equilibrium │ ↓ Active L858R Inactive ↓ ↓ Active ↑↑↑所以L858R不是简单地“让ATP结合更强”。它更核心的作用是改变active/inactive构象之间的能量平衡使active kinase构象更容易出现。近期结构/动力学研究也支持 L858R 会稳定活性构象并影响EGFR二聚化及更高阶组装。四、Exon 19 deletion为什么也会激活EGFR这里就非常适合做结构模拟。经典突变E746_A750del删除E746 L747 R748 E749 A750也就是ELREA它所在的位置非常关键β3 │ ↓ β3–αC loop │ ↓ αC-helixαC-helix 是EGFR kinase activation的核心结构元件。可以简单画成β3 │ │ └──── loop ──── αC helix │ │ ↓ active/inactive switchExon19 deletion缩短了这个loop。于是会使αC-helix更倾向于inward / active position而不是outward / inactive position所以Ex19 deletion ↓ β3-αC loop缩短 ↓ αC-helix构象受到限制 ↓ active conformation ↑ ↓ EGFR kinase activity ↑这也是为什么 Ex19del 和 L858R 都属于经典的EGFR sensitizing mutations。不过有一个非常重要的结构计算细节不要期待突变后一定出现“肉眼可见的大结构变化”。一些晶体结构研究发现Ex19del和WT整体结构差异可能并不巨大真正重要的可能是构象分布、动态行为以及active/inactive state population改变。这就是为什么MD往往比单纯的静态结构比较更有价值。五、Exon 20 insertion为什么反而容易耐药这就是一个非常漂亮的结构药理学案例。典型D770_N771insNPG发生在αC-helix / αC-β4 loop附近插入的氨基酸形成一个类似structural wedge结构楔子把αC-helix推向active conformation。可以理解为WT αC-helix ↔ inactive / active Ex20 insertion NPG ↓ [WEDGE] ↓ αC-helix → ACTIVE因此Ex20 insertion ↓ αC-helix被锁定 ↓ active kinase ↓ 持续信号但问题来了为什么它不像L858R一样对经典TKI敏感关键在于ATP affinity 和 inhibitor affinity 的变化不一样。L858R / Ex19delATP affinity ↓ ↓ TKI相对更容易竞争ATP ↓ drug sensitivity ↑而典型Ex20insATP affinity ≈ 保持 ↓ ATP仍然强烈竞争 ↓ 经典TKI难以获得足够选择性同时插入突变会使αC-helix phosphate-binding loopP-loop发生位置变化部分药物进入结合口袋时出现steric hindrance空间位阻。这就是为什么“都是EGFR激活突变”但药物敏感性却完全不同。六、所以我们可以建立一个非常漂亮的结构模型把三个突变放在一起EGFR kinase domain N-lobe C-lobe ┌─────────────┐ ┌───────────────┐ │ │ │ │ │ β-sheet │ │ catalytic │ │ │ │ loop │ │ αC-helix │ │ │ │ ↓ │ │ activation │ │ ATP │ │ loop │ └─────────────┘ └───────────────┘ ↑ ↑ ↑ Ex19del L858R T790M ↑ Ex20ins更准确地说突变主要影响Ex19delβ3–αC loop / αC-helixL858Ractivation loopEx20insαC-helix/αC-β4 loopT790MATP pocket gatekeeperC797SATP pocket / covalent inhibitor site七、接下来就进入你真正关心的怎么做结构预测这里建议你不要一上来就AlphaFold。如果研究EGFR第一优先级直接使用实验结构。因为EGFR kinase domain已经有大量WTL858REx19delT790Mdrug-bound晶体结构。例如经典EGFR-erlotinib结构PDB: 1M17就是非常经典的EGFR kinase结构。八、什么时候使用AlphaFold如果研究的是EGFR-WT EGFR-L858R EGFR-Ex19del EGFR-Ex20ins并且某个具体突变没有实验结构可以方法1AlphaFold 3 / AlphaFold 2预测EGFR-WT ↓ 结构预测 EGFR-L858R ↓ 结构预测 EGFR-Ex19del ↓ 结构预测 EGFR-Ex20ins ↓ 结构预测然后比较。但是AlphaFold给你的主要是一个静态结构模型而突变导致的功能差异往往属于构象动力学问题。因此AlphaFold → MD通常比AlphaFold → docking更加合理。九、推荐完整计算流程如果以后想真正做一个论文级的EGFR计算药物研究可以按照EGFR mutation │ ┌───────────┼───────────┐ ↓ ↓ ↓ L858R Ex19del Ex20ins │ │ │ └───────────┼───────────┘ ↓ Protein structure ↓ Experimental PDB / AF3 ↓ Structure QC ↓ WT vs mutant comparison ↓ Molecular dynamics ↓ ┌────────────────┼─────────────────┐ ↓ ↓ ↓ RMSD/RMSF Rg/H-bond PCA/DCCM ↓ ↓ ↓ Conformational analysis ↓ Binding pocket ↓ Drug docking ↓ ┌───────────┼────────────┐ ↓ ↓ ↓ Gefitinib Osimertinib New compounds ↓ ↓ ↓ MD simulation ↓ MM/PBSA/MMGBSA ↓ Binding free energy ↓ Lead compound selection ↓ Experimental validation十、第一步获取EGFR结构建议优先从PDB获取。例如WT EGFR可以选择经典1M17EGFR kinase erlotinib。还可以寻找EGFR WT apoEGFR L858REGFR T790MEGFR Ex20insEGFR gefitinibEGFR osimertinib十一、第二步建立突变体例如你有WT EGFR要构建EGFR L858R EGFR E746_A750del EGFR D770_N771insNPG EGFR T790M可以使用PyMOLChimeraXFoldXRosetta/PyRosettaModeller非常建议你把这个EGFR案例作为PyRosetta练习项目。十二、为什么不能直接把突变后的结构拿去Docking这是非常关键的一点。例如WT EGFR ↓ L858R直接L858R ↓ Docking ↓ Osimertinib存在一个问题突变侧链只是“换了一个氨基酸”并不代表整个蛋白已经达到了真实的突变构象。所以需要mutation ↓ side-chain repacking ↓ energy minimization ↓ MD equilibration ↓ conformational sampling ↓ representative structure ↓ docking这会更加可靠。十三、第三步能量最小化比如EGFR-L858R ↓ 添加氢 ↓ 补缺失原子 ↓ 选择质子化状态 ↓ force field ↓ Energy minimization可以使用AMBERGROMACSOpenMMRosetta推荐GROMACS作为MD主工具。十四、第四步MD模拟这一步实际上是整个研究最关键的地方。例如EGFR-WT EGFR-L858R EGFR-Ex19del EGFR-Ex20ins分别Protein ↓ TIP3P water ↓ Na/Cl- ↓ NPT ↓ Equilibration ↓ Production MD例如可以设计每个体系 3 × 100 ns 或者 3 × 200 ns而不是只跑一次100 ns。因为单次MD trajectory很容易受到初始构象和随机速度的影响。十五、MD到底看什么RMSD、Rg、氢键等。1. RMSD看整体结构稳定性RMSD │ │ ───────── │ ── │ ── └──────────────── time比较WT L858R Ex19del Ex20ins十六、RMSF看哪些氨基酸运动发生变化RMSF │ /\ /\ │ / \ / \ │_____/____\__________/____\____ ↑ αC重点观察αC-helixactivation loopP-loopgatekeeper regioncatalytic loop如果L858R导致activation loop运动模式改变RMSF可能直接体现出来。十七、RgEGFR kinase domainRadius of gyration主要用于判断整体紧致程度有没有变化。但对EGFR突变而言Rg通常不是最有解释力的指标。所以不要把论文重点放在Rg。十八、氢键分析非常重要。例如L858R ↓ Arg858 ↓ 与附近残基形成新的 electrostatic interaction /H-bond ↓ activation loop稳定这类分析可以直接把“突变”连接到“结构机制”。十九、更加重要距离分析例如Arg858 │ │ distance ↓ Asp / Glu统计distance vs time如果WT interaction occupancy 10% L858R interaction occupancy 70%就能说明突变形成了新的稳定相互作用网络。二十、非常推荐做DCCMDynamic Cross-Correlation Matrixresidue 1 2 3 4 5... ┌───────────── 1 │ - - 2 │ - - 3 │ - - │它可以回答L858R是不是改变了不同结构区域之间的协同运动例如activation loop ↕ αC-helix ↕ ATP pocket如果突变改变了这些区域之间的动态耦合这比单纯说“RMSD变化了0.2 Å”有生物学意义得多。二十一、PCA也非常重要Principal Component AnalysisPC2 ↑ │ WT │ ● ● ● │ │ L858R │ ● ● ● │ └──────────────────→ PC1如果WT trajectory和L858R trajectory在PCA空间明显分开说明突变改变了蛋白的主要构象运动模式。这对于EGFR特别有价值。二十二、下一步药物分子对接假设你研究Osimertinib可以设计EGFR-WT osimertinib EGFR-L858R osimertinib EGFR-Ex19del osimertinib EGFR-Ex20ins osimertinib然后进行Molecular docking常用AutoDock VinaGlideGOLDAutoDock4你已经在学习Vina因此完全可以用Vina → PyRosetta/GROMACS → MD这个组合。二十三、Docking真正回答什么问题Docking主要回答“药物能不能以合理构象进入这个binding pocket”例如EGFR ┌───────────────┐ │ │ │ ATP pocket │ │ ↓ │ │ ┌───────┐ │ │ │ Drug │ │ │ └───────┘ │ │ │ └───────────────┘然后看binding posehydrogen bondπ-π interactionhydrophobic interactionsalt bridgesteric clash二十四、EGFR药物最经典的结合方式以第一代TKI为例EGFR ATP-binding pocket hinge region ↓ ────────── │ Drug │ ──────────许多ATP竞争型EGFR-TKI会与hinge region形成关键氢键。所以ATP ↓ ATP pocket Drug ↓ 竞争ATP ↓ EGFR phosphorylation ↓ ↓ RAS/MAPK ↓ PI3K/AKT ↓ ↓ tumor cell proliferation ↓二十五、Osimertinib为什么更厉害Osimertinib是第三代EGFR-TKI。它有一个非常关键的特点covalent irreversible inhibition也就是EGFR Cys797 ↑ │ └── covalent bond ↑ Osimertinib所以Osimertinib ↓ 进入ATP pocket ↓ 识别Cys797附近区域 ↓ 形成共价键 ↓ EGFR kinase被不可逆抑制这也是为什么在结构计算中Osimertinib不能完全按照普通reversible docking理解。最好采用covalent docking / covalent modeling或者至少在MD中明确考虑Cys797共价连接状态。二十六、然后进入MD验证Docking结果这一步就是你之前一直在问的为什么Vina以后还要做MD原因非常简单Vina静态结构 ↓ 搜索几个可能poseMDprotein ligand water ↓ 真实动态环境 ↓ 100 ns / 200 ns ↓ 判断这个pose是否稳定因此Vina ↓ Top 10 poses ↓ 选择合理pose ↓ MD ↓ 稳定pose二十七、MD中重点看Drug-Protein interaction例如Hydrogen bond occupancyDrug │ ├── H-bond → Met793 │ ├── H-bond → Lys745 │ └── interaction → Cys797计算occupancy比如Met793 H-bond occupancy 82% Cys797 interaction 91%比单纯Docking的-8.5 kcal/mol更有说服力。二十八、再进一步做MM/PBSA例如WT drug L858R drug Ex19del drug Ex20ins drug计算ΔGbind通常ΔGbind ΔEMM ΔGpolar ΔGnonpolar - TΔS最终可以比较EGFRDrugΔGbindWTOsimertinib-XL858ROsimertinib-YEx19delOsimertinib-ZEx20insOsimertinib-A如果L858R -60 Ex19del -58 Ex20ins -40那么可以提出Ex20ins对该药物结合不利。但要注意MM/PBSA适合做相对比较和机制支持不应该把绝对数值当成真实实验Kd。二十九、如果要真正“设计药物”应该怎么做这就进入Structure-based drug design整个过程Mutation ↓ Structure ↓ Binding pocket ↓ Hotspot identification ↓ Virtual screening ↓ Docking ↓ MD ↓ MM/GBSA ↓ Lead compounds ↓ Molecular optimization ↓ Experimental validation三十、例如你要针对EGFR Ex20ins设计药物这是非常有研究价值的。因为Ex20ins存在经典TKI耐药问题。结构研究发现Ex20 insertion ↓ αC-helix位置变化 ↓ ATP pocket空间变化 ↓ 经典TKI steric clash ↓ drug resistance因此你的设计策略可以是Strategy 1寻找能够避开steric clash的ATP-site inhibitorStrategy 2设计Covalent inhibitor寻找Cys797附近合理exit vector。Strategy 3设计Allosteric inhibitor不再直接竞争ATP。而是allosteric pocket ↓ 锁定inactive EGFR ↓ 阻止activation这类思路非常重要因为近年来EGFR结构药理学越来越强调conformational/selective allosteric inhibition而不是单纯ATP竞争。三十一、这就是“突变 → 药物”的完整逻辑可以把整个科学问题总结成EGFR mutation │ ┌─────────────┼─────────────┐ ↓ ↓ ↓ L858R Ex19del Ex20ins │ │ │ ↓ ↓ ↓ Activation loop αC-helix αC-helix │ │ │ └─────────────┼─────────────┘ ↓ kinase conformation ↓ active/inactive equilibrium ↓ ATP binding ↓ drug binding pocket ↓ ┌────────────┴────────────┐ ↓ ↓ sensitive resistant ↓ ↓ EGFR inhibitors novel inhibitors ↓ ↓ Docking Docking ↓ ↓ MD MD ↓ ↓ MM/PBSA MM/PBSA ↓ ↓ validation optimization三十二、如果把它做成一个真正的科研项目建议直接做下面这个课题“EGFR不同驱动突变的结构动力学特征及靶向抑制剂结合机制研究”设计4组Group 1 EGFR-WT Group 2 EGFR-L858R Group 3 EGFR-Ex19del Group 4 EGFR-Ex20ins每组apo protein drug-bound protein于是4 × 2 8个体系例如WT L858R Ex19del Ex20ins × apo osimertinib三十三、计算分析指标可以这样安排第一层结构RMSD RMSF Rg SASA secondary structure第二层构象PCA DCCM Free energy landscape第三层局部结构重点αC-helix P-loop activation loop hinge gatekeeper Cys797第四层药物结合H-bond hydrophobic interaction π-π salt bridge contact frequency distance第五层自由能MM/PBSA MM/GBSA per-residue decomposition三十四、最终最有价值的是“Residue decomposition”这个非常适合做论文图。例如Residue contribution Met793 ███████████ Leu718 ███████ Val726 █████ Lys745 ████ Cys797 █████████ Arg858 ██然后你就可以回答到底是哪些氨基酸决定了突变体与药物的结合差异进一步Mutation ↓ Residue interaction network ↓ Binding pocket remodeling ↓ Drug binding change这就从“做MD”升级到了“解释药物机制”。三十五、进一步可以做虚拟筛选如果你不是只研究现有药物而是想“寻找一个新的EGFR突变选择性抑制剂”可以EGFR mutant structure ↓ Binding pocket ↓ ZINC / Enamine / ChEMBL等化合物库 ↓ Virtual screening ↓ Docking ↓ Top 100 ↓ Top 20 ↓ MD ↓ MM/GBSA ↓ Top 5 ↓ 实验三十六、甚至可以进一步做AI药物设计这就是现在非常热门的方向EGFR mutation ↓ Structure ↓ Pocket ↓ AI molecular generation ↓ 生成新分子 ↓ Docking ↓ MD ↓ ADMET ↓ 合成 ↓ 实验验证例如可以结合AlphaFold 3Diffusion-based molecular designProteinMPNN更偏蛋白设计RFdiffusion蛋白/结合蛋白设计DiffDockGNINAAutoDock VinaGROMACSPyRosetta形成AI Structure-based Drug Design MD的完整体系。三十七、这里有一个非常重要的现实问题不能简单理解成“Docking分数最低 最好的药。”实际上Docking score ↓ 只是第一轮筛选真正可靠的证据链应该是Docking ↓ 合理binding pose ↓ MD稳定 ↓ 关键H-bond/contact稳定 ↓ PCA/DCCM支持构象机制 ↓ MM/PBSA支持结合差异 ↓ 突变体选择性 ↓ 细胞实验 ↓ 酶活实验 ↓ SPR/ITC/Kd ↓ 动物实验最终才能形成完整的药物发现证据链。三十八、目前EGFR临床药物也可以作为这个体系的真实案例对于经典Exon 19 deletion / L858R目前临床上已经有多种EGFR靶向方案第三代TKIosimertinib是非常重要的代表FDA也批准其用于这两类EGFR突变的NSCLC并批准其与铂类化疗联合的一线方案。此外2024年FDA还批准lazertinib amivantamab用于EGFR Ex19del/L858R的一线治疗。而对于EGFR Exon 20 insertion情况完全不同。这正好说明“同一个靶点、不同突变 → 不同蛋白构象 → 不同药物结合模式 → 不同临床药物敏感性。”截至目前FDA已经在2025年批准sunvozertinib用于铂类化疗后进展的EGFR Exon 20 insertion转移性NSCLC。所以Ex20ins是一个非常适合做突变结构 → docking → MD → 药物设计的真实案例。最后把整套方法浓缩成一句话真正要学习的不是“怎么跑Vina”或者“怎么跑GROMACS”而是下面这个逻辑EGFR突变改变局部结构和构象能量景观 → 改变αC-helix、activation loop、ATP pocket等关键区域的动态行为 → 改变ATP/TKI结合模式 → 造成药物敏感或耐药 → 利用结构预测、分子对接和MD寻找稳定结合构象 → 用MM/PBSA和残基能量分解定位关键作用残基 → 根据突变特异性口袋设计/筛选新的EGFR抑制剂 → 最终通过酶活、SPR/ITC、细胞和动物实验验证。这实际上就是一个完整的结构基础药物设计Structure-Based Drug Design, SBDD项目。下一步最推荐直接做一个“EGFR-L858R从PDB结构获取 → PyMOL构建突变 → GROMACS建模 → 100 ns MD → RMSD/RMSF/PCA/DCCM → AutoDock Vina对接Gefitinib/Osimertinib → 再MD → MM/PBSA → PyMOL出论文级结构图”的完整实战案例。生活很好有你更好。