20 年

白金会员

已认证

AI药物发现|从200万真实筛选到14亿虚拟筛选

从近200万化合物真实筛选到14亿化合物虚拟筛选,Genentech如何利用AI拓展抗菌药发现化学空间。


AI药物发现,难点不只在模型

从图神经网络到大模型,从分子生成到虚拟筛选,各类AI技术不断涌现。对于一线研发团队来说,一个现实问题始终存在:实验能够覆盖的化学空间其实非常有限。即使是大型HTS项目,通常也只能筛选百万级化合物,而理论上的药物样化学空间被认为远远超过这一数量级。已有的一些AI抗生素发现研究,由于使用规模较小的训练集,且训练样本常集中于已知抗生素、天然产物或已上市药物,对更广化学空间的泛化能力仍然有很多提升空间。如果训练数据本身不够丰富,AI到底能学到什么?


Genentech联合NVIDIA和Mila发表在《Nature Biotechnology》的一项研究,给出了一个值得关注的解法。研究团队并没有把重点放在只做一个虚拟筛选模型,而是尝试解决一个更基础的问题——如何获得足够大、足够多样化的实验数据,以真实实验结果训练深度学习模型,让AI将搜索范围扩展至HTS实验未直接覆盖的大规模可合成化学空间。


先完成一个小目标:

近200万化合物的表型筛选项目

研究团队首先对1,981,993个小分子进行了表型高通量筛选,筛选对象是E. coli ΔtolC菌株。实验获得5,161个活性化合物,对应初始HTS命中率为0.26%。从比例上看这个命中率并不高,但作者更看重的是数据的广度。研究指出,即便10^6–10^7级实验筛选也只能覆盖巨大化学空间的一小部分。这批HTS数据的价值不只是“找到了多少活性化合物”,更在于它给模型提供了大量活性与非活性化合物之间的结构—活性信息。这套筛选库覆盖了多样化的化学空间区域,并包含activity cliffs等信息,可用于训练模型识别细微结构变化与活性之间的关系。


113057_909375_jsue_gsdt.png

图1.大规模HTS数据驱动的深度学习虚拟筛选流程


GNEprop:

从化学结构预测抗菌活性

基于这批HTS数据,研究团队训练了深度学习模型GNEprop。GNEprop是一个以分子图结构为输入的图神经网络模型,用于预测小分子的抗菌活性。研究人员对模型的要求并不只是“在已有数据上表现好”,更关注模型能否推广到训练集中未充分覆盖的新化学空间,也就是out-of-distribution(OOD)泛化能力。


为此,团队设计了更严格的scaffold-cluster split评估方式,用来模拟真实虚拟筛选中模型面对陌生化学空间的情况。研究还采用了自监督预训练:先利用1.22亿个未标注分子学习通用分子表示,再用HTS实验数据进行微调。


从200万到14亿:模型将十亿级

空间缩小到可验证候选

模型训练完成后,团队将GNEprop用于Enamine REAL数据库的虚拟筛选。这个数据库包含约14亿个可合成化合物。研究团队在64块A100 GPU上,对整个空间的8个模型重复预测在48小时内完成。随后,模型预测44,437个具有抗菌活性的候选分子。


这些候选分子经过聚类、多样性选择、过滤和实验预算限制后,最终有345个分子被成功合成并带回实验室验证。其中82个化合物达到≥80%生长抑制标准,被定义为确认活性(confirmed actives)。对应命中率为23.8%。对比最初HTS筛选的0.26%命中率,AI辅助后的实验验证命中率提升约90倍。也就是说,在这项研究中,模型排序后的候选集合在实验验证中表现出更高命中率。


对于抗菌药发现来说,提高命中率当然重要,能否找到新的化学骨架同样关键。确认活性的虚拟筛选分子中,98.8%与已知抗生素的最大Tanimoto相似度≤0.4;其中39%的相似度≤0.2。此外,确认活性分子中有一部分与HTS训练集活性分子也具有较低相似度。结果表明,模型不仅是在“找像已知抗生素的分子”,而是在更广的可合成化学空间中找到结构上更不同的抗菌活性分子。


113158_900394_jsue_gsdt.png


图2.化学空间分布可视化UMAP。每个点代表一个化合物,不同颜色表示不同来源。GNEprop发现的活性化合物分布在与已知抗生素和HTS活性化合物不同的区域,表明模型能够探索更广泛的化学空间。右侧放大图展示了部分代表性分子的结构示例。图中已知抗生素和GNEprop命中化合物均进行了随机抽样展示。


不是AI替代实验,

而是数据—模型—实验循环

这项工作的核心并不是“用了一个AI模型,所以找到了活性分子”。它展示了一种更完整的工业化路径:先用大规模实验建立训练数据,再用模型扩展到远大于实验可直接覆盖的化学空间;随后把模型预测结果带回实验室验证,并用新的实验结果继续丰富对化学空间的理解。研究者提到,模型性能并没有在当前数据规模下完全达到平台期,更多数据可能进一步提升模型表现。


自动化实验平台扮演重要角色

“数据—模型—实验”循环能否跑通,离不开稳定、可扩展的实验数据生成能力。研究团队在初始HTS阶段,采用了Echo声波移液系统进行1536孔板超高通量化合物实验;在后续虚拟筛选命中化合物验证中,继续采用Echo赋能高质量筛选实验数据输出。


对于AI药物发现而言,模型与实验平台协调工作,才能形成真正可迭代的发现体系。Echo声波移液系统ACCESS自动化整合系统,作为生成训练数据和验证数据的重要实验基础设施,将持续赋能AI药物筛选。


113301_948138_jsue_gsdt.png

了解更多Echo声波移液系统

即刻扫码下载


参考文献

[1]. Scalia G., Rutherford S.T., Lu Z., Buchholz K.R., Skelton N., Chuang K., Diamant N., Hütter J.C., Luescher J.M., Miu A., et al. Deep-learning-based virtual screening of antibacterial compounds. Nature Biotechnology, Published online: 24 October 2025. 

贝克曼库尔特生命科学  2026-08-06  |  阅读:35
最新动态
更多  
推荐产品 供应产品

分类

请拨打厂商400电话进行咨询

立即拨打

中国粉体网认证电话,请放心拨打
(暂不支持短信)

×
是否已沟通完成
您还可以选择留下联系电话,等待商家与您联系

需求描述

单位名称

联系人

联系电话

已与商家取得联系
同意发送给商家
留言咨询

留言类型

需求简述

联系信息

联系人

单位名称

电子邮箱

手机号

图形验证码

点击提交代表您同意《用户服务协议》《隐私协议》