用ChEMBL、RDKit、SHAP和BRICS构建EGFR抑制剂发现AI协同科学家:完整教程
本文详解如何利用ChEMBL、RDKit、SHAP和BRICS构建一个自主AI协同科学家工作流,用于发现针对EGFR C797S耐药突变的新一代抑制剂。涵盖从靶点解析、数据挖掘、模型训练到分子生成的全流程,适合药物化学和计算化学从业者。
一句话看懂
一个端到端的AI协同科学家工作流,利用ChEMBL数据、RDKit分子处理、随机森林QSAR模型和BRICS碎片重组,自动发现针对EGFR C797S耐药突变的新型抑制剂候选分子。
详细发生了什么
该教程构建了一个完整的自主AI协同科学家流程,用于发现针对非小细胞肺癌中奥希替尼耐药突变C797S的下一代EGFR抑制剂。流程从ChEMBL和UniProt解析靶点开始,挖掘EGFR IC50生物活性数据并转换为干净的pIC50建模数据集。使用RDKit标准化分子、去除盐、聚合重复测量、计算Morgan指纹、提取理化描述符并分析骨架多样性,确保模型从化学上有意义的表征而非原始字符串中学习。
接着,训练一个骨架分裂的随机森林QSAR模型,评估其对未见化学类型的泛化能力,用SHAP或模型重要性解释效力驱动特征,并可视化有影响的分子亚结构。最后,通过重组来自有效药物类似物的BRICS片段进入生成设计,对产生的虚拟类似物进行效力、药物相似性、可合成性、新颖性和可开发性评分,并在PubChem中交叉检查候选列表。
教程还提供了完整的Python代码实现,包括靶点解析、数据挖掘、分子处理、模型训练和分子生成等步骤。
中文圈视角
对于中文圈的药物化学和计算化学从业者,这个教程提供了一个可复现的AI驱动药物发现工作流模板。虽然使用了ChEMBL和PubChem等国际数据库,但国内用户可以通过类似思路利用本地数据(如中国药科大学的药物数据库)或国产替代平台(如ModelScope上的分子生成模型)进行适配。
关键差异点:国内用户可能需要关注数据合规性,特别是使用ChEMBL数据时需遵守其CC BY-SA 4.0许可。此外,教程中的BRICS片段重组方法可以结合国产分子生成工具(如深势科技的Uni-Mol)进行优化。对于EGFR C797S抑制剂这一具体靶点,国内已有多个团队在攻关,该工作流可作为快速筛选起点。
一个未被广泛讨论的盲点:教程中的骨架分裂策略对于评估模型泛化能力至关重要,但国内很多QSAR研究仍使用随机分裂,导致模型性能被高估。该教程强调了骨架分裂的重要性,值得国内研究者借鉴。
几条值得记住的细节
- 靶点解析:使用ChEMBL ID CHEMBL203(EGFR)和UniProt上下文,明确C797S耐药突变背景。
- 数据挖掘:从ChEMBL拉取最多9000条IC50记录,经过质量过滤后得到标准化的pIC50数据集。
- 分子处理:使用RDKit的LargestFragmentChooser和Uncharger进行标准化,计算2048位Morgan指纹(半径2)。
- 模型训练:采用骨架分裂的随机森林回归模型,用SHAP解释效力驱动特征。
- 分子生成:通过BRICS碎片重组生成最多4000个虚拟类似物,经多轮筛选后保留12个候选分子。
一句话总结
这个教程提供了一个从靶点到候选分子的完整AI药物发现工作流,可直接复现并适配到其他靶点,对国内计算化学研究具有实用参考价值。