东北证券研究所报告指出,靶点识别是开发新药最重要的步骤之一。目前靶点识别的方法包括实验法(基于亲和力、化学遗传学、比较分析)、多组学法(基因组学、转录组学、蛋白质组学、表观基因组学、代谢组学)和计算法三类。将多组学数据与人工智能算法结合的靶点识别方法正获得广泛关注,被认为具有广阔的应用前景。AI通过使用公开获取的组学数据和文本数据,应用多种靶点选择标准,有望加快药物靶点的选择与确认,显著减少靶点确认和验证所需的时间和成本。
靶点识别是药物发现的关键第一步
药物靶点是机体内与特定的疾病过程内在相关,并与药物直接结合以产生相互作用的生物分子。靶点识别即识别可被药物调节以实现治疗的正确生物分子或细胞通路的过程。一个好的靶点需要是有效的、安全的、临床可行且有商业价值的,最重要的是要具有“可药性”。因此,开发新药最重要的步骤之一就是靶点的选择和确认。
当前靶点识别的方法可分为三类:实验法根据亲和力、化学遗传学和比较分析来确认靶点;多组学法通过分析各种组学数据集(如基因组学、转录组学、蛋白质组学、表观基因组学和代谢组学)来预测基因与疾病的关联;计算法通过使用机器学习或基于结构的方法有效的确认潜在靶点。
实验法靶点确认:从“以药找靶”到基因编辑
基于亲和力的方法是“以药找靶”的常用方法,其原理为利用药物分子与靶点之间的特异性结合,将靶点从复杂的生物样本中分离出来。流程为向容器中加入生物样本,靶蛋白与琼脂糖珠上的配体结合,未结合的蛋白质被清洗后,再使用洗脱液从配体中释放靶蛋白。
化学遗传学方法通过抑制靶基因表达或编辑靶基因用于靶点的发现与验证。以RNAi为例,RNA干扰技术(RNAi)是将外源或内源的双链RNA导入细胞后引起与dsRNA同源的靶基因降解,进而抑制靶基因表达。siRNA作用机制为dsRNA或shRNA被核酸内切酶Dicer切割为siRNA,与Argonaute-2蛋白结合形成RISC,切割靶mRNA起到基因沉默效果。比较分析方法中,SILAC是靶点识别中最常用的定量蛋白质组学方法,通过稳定同位素标记比较两组蛋白质丰度,鉴定特定靶蛋白。
多组学+AI:靶点识别的前沿方向
基于NGS的多组学方法可用于靶点发现和验证,AI可提供助力。新一代测序技术(NGS)持续发展推动基于NGS的多组学方法整合到药物开发工作流程中。在药物靶点发现阶段,多组学方法可以对“可操作”实体进行无偏差鉴定,作为现有药物或新候选药物的靶点。在靶点验证阶段,多组学方法可用于分析基因功能分子敲除或敲低在转录组、表观基因组和蛋白质组中的表型效应。
尽管多组学数据提供了多方面的分子信息,但确定可操作的治疗靶点仍然充满挑战。将多组学数据与人工智能算法结合的靶点识别方法正获得关注,被认为具有广阔的应用前景。AI根据特定指示,使用多个模型对靶点进行优先级排序,这些模型利用了多种公开获取的组学数据和文本数据。组学数据包括基因组学、转录组学、蛋白质组学、表观基因组学和代谢组学;文本数据从资金报告、专利、出版物和临床试验中检索。
AI驱动靶点识别:加速靶点发现的新范式
在靶点优先级排序中,可以应用多种靶点选择标准来提炼靶点清单,包括疾病与靶点之间的因果关系、发展现状(临床试验阶段、配体/化合物可获得性)、可药性(蛋白质定位、治疗方法、蛋白质结构可获得性)、毒性(基因重要性、组织特异性、涉及细胞过程)、创新性等。AI的应用有望加快药物靶点的选择与确认,显著减少靶点确认和验证所需的时间和成本,提高新靶点和新疗法的开发效率。
此外,AI可用于创建合成数据模拟各种生物场景,以解决一些治疗领域试验数据稀缺或难以获得和数据不平衡或有偏等问题,帮助发现复杂疾病的新靶点和新通路。随着深度学习算法和多组学技术的持续发展,AI辅助靶点识别有望成为新药研发效率提升的关键突破口。
| 方法类别 | 具体方法 | 原理 | AI应用场景 |
|---|
| 实验法 | 基于亲和力 | “以药找靶”,靶蛋白与配体结合 | 结合数据分析优化 |
| 实验法 | 化学遗传学(RNAi) | dsRNA干扰靶基因表达 | 基因功能预测 |
| 实验法 | 比较分析(SILAC) | 稳定同位素标记比较蛋白质丰度 | 质谱数据分析 |
| 多组学法 | NGS多组学 | 基因组/转录/蛋白/代谢组学 | 多模态数据融合 |
| 计算法 | 机器学习/深度学习 | 基于结构或数据驱动 | 靶点排序、合成数据生成 |