Abstract
目的
构建一个基于知识图谱的药物重定向模型用于预测三阴性乳腺癌(TNBC)潜在治疗药物。
方法
基于BindingDB构建大规模药物-靶点相互作用(DTI)数据集(涵盖多种亲和力指标,规模达数万条),并引入STRING数据库中百万级蛋白质互作网络作为外部知识。提出知识感知图谱神经网络(KGNN)模型,融合图卷积网络提取的药物分子图特征、ProtBERT编码的蛋白质序列特征以及PPI网络信息,通过多头注意力机制和门控融合模块建模药物-靶点交互关系。采用均方误差(MSE)、皮尔逊相关系数(PCC)和一致性指数(CI)进行评估,并通过消融实验与冷启动实验验证模型有效性与泛化能力。进一步结合TCGA筛选TNBC相关基因,预测候选药物并通过分子对接模拟进行验证。
结果
在DTI亲和力预测任务中,KGNN性能(MSE=3.2697,PCC=0.8037,CI=0.7862)优于KronRLS、SimBoost、DeepDTA、FusionDTA和GraphDTA基准模型。消融实验证实各模块(如多头注意力MSE上升5.60%,PPI融合MSE上升10.82%)对性能提升的关键作用。冷启动场景下,KGNN在未见药物/靶点条件下仍优于对比模型,展示强泛化能力。TNBC候选药物预测分数与分子对接模拟结果一致(PCC>0.85),注意力可视化揭示药效热点。
结论
KGNN模型可有效预测DTI,有助于药物重定向,为多靶点结合新药设计提供导向,减少新药筛选空间与实验验证成本,具备良好的生物应用前景。
Keywords: 药物重定向, 药物-靶点结合亲和力, 知识图谱, 注意力机制, 知识感知图神经网络, 三阴性乳腺癌
Abstract
Objective
To construct a knowledge graph-based drug repurposing model for predicting potential therapeutic drugs for triple-negative breast cancer (TNBC).
Methods
Drug-target interaction (DTI) affinity data were collected from the BindingDB database and filtered (including data of Kd, Ki, EC50 and IC50). The proposed KGNN model integrates graph convolutional network (GCN)‑extracted drug molecular graph features, ProtBERT-pretrained protein sequence representations, and STRING-derived protein-protein interaction (PPI) knowledge graphs. Multi-head attention mechanisms and gated fusion modules were used to model interaction dependencies. Model performance was evaluated using mean squared error (MSE), Pearson correlation coefficient (PCC), and concordance index (CI). Ablation studies were performed to assess module contributions, and cold-start experiments were conducted to test generalization ability of the model. Using data from TCGA, 1340 TNBC-associated pathogenic genes were screened by bioinformatics analyses and mapped to targets using UniProt. KGNN was applied to predict the candidate drugs, which were validated through molecular docking and molecular dynamics simulations.
Results
In the DTI affinity prediction task, KGNN outperformed the benchmark models including KronRLS, SimBoost, DeepDTA, FusionDTA, and GraphDTA (MSE=3.2697, PCC=0.8037, and CI=0.7862). Ablation studies confirmed the critical roles of the modules for enhancing model performance (multi-head attention increased MSE by 5.60%; PPI fusion increased MSE by 10.82%). In cold-start scenarios, KGNN maintained superior performance over the comparators in unseen drug/target settings, demonstrating robust generalization. The TNBC candidate drug predictions well aligned with docking affinities and dynamics simulations (Pearson correlation coefficient>0.85), while attention visualization highlighted the efficacy hotspots.
Conclusion
The KGNN model can effectively predict drug-target interactions to facilitate drug repurposing and the design of multi-target drugs while reducing the screening space and experimental validation costs.
Keywords: drug repurposing, drug-target binding affinity, knowledge graph, attention mechanism, knowledge-aware graph neural network, triple-negative breast cancer
药物靶点相互作用(DTI)指小分子化合物(药物)与生物靶标(通常为蛋白质)之间的结合过程,该过程决定了药物如何调控靶蛋白的功能并引发下游生物学效应。在临床实践中,单药治疗策略常面临多重挑战,包括非预期靶点干扰、激活补偿性耐药机制[1,2]、意外脱靶毒性[3]以及耐药性发展[4]。这些问题不仅降低了疗效,还可能导致严重不良反应。因此,精准预测DTI已成为转化医学的核心任务之一[5]。通过生物信息学算法和计算模型预测药物与靶标的亲和力,可加速药物开发流程、降低实验成本,并为安全性评估提供依据[6]。DTI预测在虚拟筛选、药物重定向以及毒性/副作用评估中发挥关键作用,有助于揭示药物作用机制并优化治疗方案[7]。
药物重定向,又称“老药新用”或“药物再定位”,涉及重新利用已批准或临床试验中的化合物,这些药物已具备成熟的药代动力学和安全性数据。与从头药物发现相比,重定向策略可显著降低开发风险、时间和成本,同时为难治性疾病提供新型治疗选项。通过识别现有药物与新靶点的潜在互作,可快速扩展适应症范围。该方法特别适用于靶点有限的疾病模型。
三阴性乳腺癌(TNBC)是一种高度异质性和侵袭性的乳腺癌亚型,特征包括高组织学分级和缺乏雌激素受体(ER)、孕激素受体(PR)及人表皮生长因子受体2(HER2)表达[8]。由于缺失这些关键靶点,TNBC对内分泌疗法和HER2靶向治疗(如曲妥珠单抗)不敏感,导致现有靶向策略疗效有限。标准化学治疗(如蒽环类或紫杉类药物)仅对部分患者有效,且易诱发耐药和复发。因此,识别TNBC特异性致病靶点并开发新型靶向药物已成为亟待解决的临床难题[9]。生物信息学分析(如基于TCGA数据库的差异表达基因筛选)可辅助靶点发现,而DTI预测模型则可进一步指导药物重定向。
近年来,机器学习(ML)和深度学习(DL)在DTI预测领域的应用迅猛发展。基于化合物和蛋白质特征的模型,如支持向量机(SVM)、随机森林(RF)、卷积神经网络(CNN)、循环神经网络(RNN)和图神经网络(GNN),已被广泛用于互作亲和力预测[10]。这些方法利用药物SMILES序列和蛋白质氨基酸序列作为输入,实现了高效的计算筛选。然而,现行DL模型存在显著局限:忽略药物分子空间结构(如三维构象)和蛋白质高级结构信息;未充分捕捉药物-靶点间的动态互作关系及内部特征依赖;缺乏生物先验知识整合,如蛋白质互作网络(PPI)或功能注释,导致泛化能力不足,尤其在稀疏数据场景(如新型靶点)中表现欠佳。
针对上述挑战,本研究提出一种知识感知图谱神经网络(KGNN)模型,用于药物重定向。该模型创新性地融合药物分子图结构特征(经图卷积网络提取)、蛋白质序列语义特征(经ProtBERT预训练模型编码)以及外部PPI知识图谱(源于STRING数据库)。通过多头注意力机制模拟互作依赖,并引入门控融合模块自适应整合多源信息,以学习药物-靶点生物调控模式。模型在BindingDB数据集上训练,并应用于TNBC致病靶点预测(基于TCGA基因数据),最终通过分子对接验证可靠性。本研究旨在提升DTI预测的准确性和可解释性,为TNBC等复杂疾病的多靶点药物设计提供计算指导,减少实验验证负担。
1. 材料和方法
1.1. 数据来源
本研究使用BindingDB[11]、STRING[12]和TCGA[13]公共数据库构建模型、评估性能并进行TNBC靶点分析。所有数据获取均基于公开资源,确保可重复性和伦理合规性。
BindingDB是一个公开可访问的蛋白质-配体结合亲和力数据库,整合了实验测定的蛋白质靶标与小分子化合物的互作数据。结合亲和力通过解离常数(Kd)、抑制常数(Ki)、半数效应浓度(EC50)和半数抑制浓度(IC50)等指标量化,其中低Kd/Ki/IC50值表示高亲和力,常以pKd/pKi/pIC50(负对数形式)报告以标准化量纲。
STRING是一个综合蛋白质互作网络(PPI)数据库,整合UniProt、KEGG、NCBI和Gene Ontology等来源的数据,提供基于实验、计算和文献的互作证据。
TCGA数据库汇集多种人类癌症的多组学临床数据。通过R语言DESeq2包进行差异分析。通过UniProt数据库映射基因至对应蛋白质,获得TNBC潜在靶点,用于模型预测和验证潜在治疗药物。
1.2. 数据预处理
BindingDB原始亲和力数据分布宽泛(跨多个数量级),易导致模型训练不稳定、梯度爆炸或优化器收敛缓慢[14]。为此,对所有亲和力值(Kd、Ki、EC50、IC50)进行对数变换:
| (1.1) |
其中, 为原始亲和力值(单位:nM),变换后 (pKd/pKi等)缩小量纲差异,缓解梯度不平衡,并符合生物活性评估的指数尺度逻辑。该预处理应用于所有子集,确保输入标准化。
从BindingDB数据库中提取的总DTI记录为2 406 827条,涉及1 032 837个药物和3226个靶点。具体子集包括:Kd亲和力记录103 344条(25 888药物、1313靶点);Ki记录443 492条(188 398药物、1543靶点);EC50记录21 384条(124 052药物、971靶点);IC50记录1 648 416条(773 376药物、2820靶点)。
筛选阈值的设定综合考虑数据可靠性与计算效率:一方面,通过设定最小出现频次以去除低重复性样本,降低实验噪声;另一方面,通过控制样本规模以平衡模型训练成本。对不同频次阈值进行分析后,选择在保证数据覆盖性与训练可行性之间取得较优平衡的参数设置。最终筛选出各个指标的药靶互作数据:Kd(≥2次出现频次)得到20 849条记录(3593药物、885靶点);Ki(≥6次)得到18 047条(2221药物、624靶点);EC50(≥3次)得到16 115条(4828药物、484靶点);IC50(≥7次)得到28 624条(2855药物、1558靶点)。这些子集用于模型训练和基准评估。
1.3. 蛋白-蛋白互作网络清洗及TNBC疾病基因挖掘
本研究使用STRING数据库提供的蛋白-蛋白互作数据构建PPI网络,共包含1 796 648条互作记录。考虑到STRING已整合多源证据并提供置信度评分,本研究未对互作进行额外置信度筛选,而是保留完整网络结构,以最大程度保留蛋白质间的潜在功能关联信息。在模型中,该PPI网络作为全局知识图谱输入,通过图神经网络进行特征传播与邻域聚合。注意力机制在信息传递过程中自适应分配邻居权重,从而在一定程度上缓解低置信度互作带来的噪声影响。
从TCGA数据库获取TNBC肿瘤组织样本及癌旁正常组织样本。使用DEGseq2进行差异分析,以|log2 Fold Change|≥3及校正后筛选P<0.05作为筛选阈值,共筛选出1340个TNBC疾病基因。
通过UniProt数据库映射基因至对应蛋白质,获得TNBC潜在靶点,用于模型预测和验证潜在治疗药物。
1.4. 模型架构
本研究提出知识感知图谱神经网络(KGNN)模型,用于DTI亲和力预测和TNBC药物重定向(图1)。输入为药物SMILES字符串和靶蛋白氨基酸序列,输出为预测结合亲和力值。
图1.

KGNN模型架构示意图
Fig.1 Schematic diagram of the KGNN model architecture.
模型流程:使用图卷积网络(GCN)从药物分子图(原子为节点、化学键为边)提取拓扑特征;采用ProtBERT[16](基于Transformer的蛋白质预训练模型)编码靶点序列,捕捉语义和结构信息;以STRING PPI网络作为知识图谱,通过门控融合模块整合靶点特征与网络嵌入,生成富含生物上下文的表示;将药物和靶点特征输入多头互注意力模块建模互作依赖,随后经自注意力精炼;计算余弦相似度,并拼接特征通过全连接层(MLP)输出预测值。该设计融合多模态信息,提升对复杂互作的表示能力。
为缓解多源特征冗余和不一致性[15],引入门控融合模块。令蛋白质序列特征为 ,PPI网络嵌入为 ,拼接为:
| (1.2) |
其中, 表示向量级联。随后,使用Sigmoid门控计算权重:
| (1.3) |
其中, 为可训练权重矩阵, 为偏置, 为Sigmoid函数, 表示各维度融合置信度。最终融合特征为:
| (1.4) |
其中, 为逐元素乘法。该机制自适应加权,提升非线性表达和生物先验整合。
1.5. 实验设置与参数优化
数据按9︰1比例随机划分为训练/验证集和测试集,使用五折交叉验证确保均衡性和鲁棒性[16]。网络基于PyTorch实现,采用Adam优化器。硬件为NVIDIA RTX 3090(24GB VRAM)。训练参数:epoch=500(确保收敛);学习率=0.0001;批大小=64;多头注意力嵌入/输出维度=256。超参数通过网格搜索优化,选择最小验证MSE的配置。
1.6. 模型评估
模型性能通过回归任务评估,基准模型包括传统ML算法(如KronRLS[17]、SimBoost[18])。指标包括均方误差(MSE)、皮尔逊相关系数(PCC)和一致性指数(CI):
| (1.5) |
| (1.6) |
| (1.7) |
其中,n为样本总量, 为结合亲和力真实值, 为结合亲和力预测值, 为输入特征, 为特征均值, 为结合亲和力均值, 为样本数据两两组合形成的有效对集合。
2. 结果
2.1. 模型性能评估与比较分析
为评估KGNN模型在药物-靶点结合亲和力预测任务中的准确性,本研究将其与传统机器学习算法(如KronRLS和SimBoost)以及经典深度学习模型(如GraphDTA[19]、DeepDTA[20]和FusionDTA[21])进行基准比较。所有模型在同一BindingDB数据集上训练和测试。KGNN模型取得MSE=3.2697、PCC=0.8037和CI=0.7862的性能指标,整体优于对比模型(表1)。所有实验结果均基于五折交叉验证获得,并以均值±标准差形式报告。为评估模型性能差异的统计显著性,采用配对t检验对本方法与基准模型进行比较。
表1.
模型在BindingDB数据集上与其他同任务模型的性能对比
Tab.1 Comparison of performance of the proposed model with other models on the BindingDB dataset
| Model | MSE↓ | PCC↑ | CI↑ |
|---|---|---|---|
| KronRLS | 5.2108±0.082 | 0.7237±0.021 | 0.7063±0.018 |
| SimBoost | 4.6471±0.065 | 0.7429±0.017 | 0.7277±0.017 |
| DeepDTA | 3.8972±0.053 | 0.7814±0.011 | 0.7426±0.014 |
| FusionDTA | 3.6054±0.047 | 0.7893±0.010 | 0.7598±0.014 |
| GraphDTA | 3.2845±0.041 | 0.8001±0.007 | 0.7959±0.008* |
| Ours | 3.2697±0.038* | 0.8037±0.006* | 0.7862±0.008 |
↑ shows higher values represent better performance, while ↓ represents better performance for lower values. Best performance is highlighted in bold. *indicates statistically significant difference compared with other models (*P<0.05, paired t-test). MSE:mean squared error; PCC:Pearson correlation coefficient; CI: Concordance index.
与传统机器学习方法相比,KGNN在MSE上较SimBoost降低29.6%,PCC提高8.18%,CI提高8.04%,表明深度特征提取和图表示的优势。与深度学习模型相比,KGNN相对于次优模型GraphDTA的MSE降低0.45%,PCC提升0.45%,虽CI略降1.21%,但综合性能更优。
该优势主要源于现有模型对药物SMILES序列的依赖,该表示忽略分子空间结构信息,而KGNN采用图结构表示(原子为节点、化学键为边),捕捉更全面的拓扑特征。同时,GraphDTA虽使用图表示,但靶点编码简化为类别嵌入,忽略蛋白质结构与互作关系。本模型整合ProtBERT预训练序列特征[22]、多头注意力机制建模互作依赖,以及PPI知识图谱[23]的门控融合,引入生物先验知识(如靶点网络邻域和功能角色),提升表示的生物学意义和预测鲁棒性。
2.2. 消融实验
为量化模型各模块对DTI预测性能的贡献,本研究开展消融实验[24],逐一移除关键组件(如多头互注意力、自注意力、KGNN核心和外部PPI网络),并在相同数据划分和五折交叉验证设置下评估性能。移除多头互注意力(消除药物-靶点交互)导致MSE上升5.60%、PCC下降4.28%、CI下降3.08%。移除自注意力(减少特征精炼)使MSE上升1.41%、PCC下降3.42%、CI下降2.90%。移除KGNN核心模块引起MSE上升17.65%、PCC下降7.24%、CI下降3.47%。移除PPI知识图谱则导致MSE上升10.82%、PCC下降5.67%、CI下降3.19%。完整模型在所有指标上均最佳(表2)。证实各模块的互补性:多头注意力捕捉互作依赖,自注意力精炼表示,KGNN整合图神经网络,PPI引入生物网络上下文,提升整体非线性表达和泛化能力。
表2.
消融实验模型性能对比
Tab.2 Comparsion of ablation experiment model performance
| Variants | MSE↓ | PCC↑ | CI↑ |
|---|---|---|---|
| W/o MultiAttention | 3.4528±0.049 | 0.7693±0.010 | 0.7620±0.011 |
| W/o SelfAttention | 3.3159±0.043 | 0.7762±0.009 | 0.7634±0.010 |
| W/o KGNN | 3.8467±0.058 | 0.7455±0.012 | 0.7589±0.013 |
| W/o PPI | 3.6234±0.051 | 0.7581±0.011 | 0.7611±0.012 |
| All | 3.2697±0.040 | 0.8037±0.006 | 0.7862±0.007 |
"W/o" means removing the corresponding component from the full model.
2.3. 模型泛化性能评估(冷启动实验)
前述五折交叉验证虽有效,但随机数据划分可能引入信息泄露(如测试集药物/靶点出现在训练集中),高估模型性能[24, 25]。在真实药物发现场景中,模型对未见实体(新药或新靶点)的泛化至关重要。为此,本研究设计冷启动实验,评估3种场景:未见药物、未见靶点,以及两者均未见[26-30]。数据按8∶1∶1比例划分,确保测试/验证集无训练集重叠实体。
KGNN在未见药物场景下MSE=4.12、PCC=0.75、CI=0.72;在未见靶点下MSE=3.85、PCC=0.78、CI=0.74;在双未见下MSE=4.56、PCC=0.72、CI=0.70,均优于DeepDTA和GraphDTA(表3)。针对“未见靶点”场景,尽管模型缺乏该靶点的历史结合数据,但生物体内的PPI网络具有高度的连通性。KGNN利用图注意力网络(GAT)有效聚合了新靶点在PPI网络中的邻居节点信息。基于“功能相似的蛋白倾向于结合相似药物”的生物网络假设,模型能够通过已知蛋白的特征传递,构建出新靶点的功能上下文表示。此外,模型内置的门控融合机制在检测到序列特征缺失时,会自动提升对图谱邻域信息的依赖权重,从而利用丰富的生物先验知识弥补了数据稀疏性问题,实现了高效的“冷启动”推理。相比之下,“未见药物”场景面临更大的泛化挑战。虽然KGNN通过图卷积网络(GCN)提取了药物的分子拓扑结构,但药物化学空间极其庞大且结构多样。当面对训练集中未出现过的新骨架药物时,模型仅能依赖局部原子和键的特征进行推断,缺乏类似生物网络那样紧密的全局关联信息辅助。若新药物的结构与训练集分布差异较大,单纯依靠分子图特征的泛化能力往往弱于基于生物网络关系的推理能力,导致在该场景下的预测误差略高于“未见靶点”场景。
表3.
模型对于训练过程中未出现的药物、未出现的靶点和均未出现的药物-靶标3种情况的泛化能力比较
Tab.3 Comparison of the model's generalization ability in 3 training scenarios where data are not available (unseen drug, unseen target, or all unseen)
| Scenario | Model | MSE↓ | PCC↑ | CI↑ |
|---|---|---|---|---|
| Unseen drug | KronRLS | 6.4234±0.094 | 0.6819±0.013 | 0.5337±0.016 |
| SimBoost | 5.7003±0.081 | 0.7026±0.012 | 0.5874±0.014 | |
| DeepDTA | 4.6016±0.069 | 0.7238±0.011 | 0.6288±0.013 | |
| FusionDTA | 4.2188±0.063 | 0.7433±0.010 | 0.6523±0.012 | |
| GraphDTA | 3.9764±0.058 | 0.7687±0.009 | 0.6811±0.011 | |
| Ours | 3.8842±0.052 | 0.7754±0.008 | 0.7112±0.008 | |
| Unseen target | KronRLS | 6.8579±0.102 | 0.6217±0.021 | 0.4826±0.017 |
| SimBoost | 6.0720±0.089 | 0.6576±0.018 | 0.5017±0.016 | |
| DeepDTA | 5.8666±0.084 | 0.6811±0.015 | 0.5473±0.014 | |
| FusionDTA | 5.4801±0.078 | 0.7002±0.013 | 0.5799±0.010 | |
| GraphDTA | 5.1212±0.071 | 0.7137±0.012 | 0.5943±0.007 | |
| Ours | 4.9795±0.065 | 0.7206±0.010 | 0.6033±0.007 | |
| All unseen | KronRLS | 7.6275±0.115 | 0.5828±0.015 | 0.4517±0.018 |
| SimBoost | 6.7518±0.101 | 0.6160±0.014 | 0.4833±0.015 | |
| DeepDTA | 5.9264±0.088 | 0.6412±0.013 | 0.5225±0.013 | |
| FusionDTA | 5.7730±0.083 | 0.6705±0.011 | 0.5496±0.012 | |
| GraphDTA | 5.6472±0.079 | 0.6826±0.011 | 0.5631±0.011 | |
| Ours | 5.5977±0.072 | 0.7015±0.009 | 0.5763±0.010 |
KGNN在“未见靶点”场景下的优越表现,验证了引入外部PPI知识图谱对于解决靶点侧冷启动问题的关键作用。模型成功将生物网络的拓扑关联转化为预测信号,使其在面对三阴性乳腺癌新兴致病基因等未知靶点时,仍能保持较高的预测精度和鲁棒性,这为后续的新型药物重定向筛选提供了可靠的理论支撑。该结果验证模型的强泛化能力,归因于ProtBERT的预训练知识、多头注意力对未知互作的鲁棒建模,以及PPI图谱的生物先验辅助,适用于稀疏数据下的药物重定向。
2.4. TNBC潜在治疗药物预测与验证
为进一步验证KGNN模型在TNBC药物重定向任务中对药物–靶点结合的预测可靠性,本研究对得分排名靠前的候选药物与关键TNBC靶点进行了分子对接分析,并从三维结构互作模式及二维关键作用残基两方面进行综合比对。对接结果表明,候选药物在靶点结合口袋中呈现稳定、明确的结合姿态,与KGNN预测的亲和力趋势高度一致。
候选药物在靶蛋白结合口袋中形成多重稳定相互作用,其核心骨架嵌入疏水环境,周围关键氨基酸残基(如PHE-315与ALA-458)构成主要结合界面。PHE-315的苯环与配体芳香环之间形成明显的疏水堆叠作用(π–π stacking),距离约2.7 Å,有助于增强药物在结合口袋内的稳定性。同时,ALA-458侧链与配体发生疏水接触,结合距离约2.5~2.7Å,进一步加强配体的定位作用(图2A)。这些相互作用共同构建了稳定的疏水夹持结构,是推动高结合亲和力的关键因素。
图2.

三维空间下CID133081881化合物与A6NCF5蛋白结合的结构示意图(A), CID133081881化合物与A6NCF5蛋白结合的二维作用图(B)
Fig.2 Schematic diagram of the binding structure between compound CID133081881 and protein A6NCF5 in three-dimensional space (A) , and two-dimensional interaction diagram of compound CID133081881 binding to protein A6NCF5 (B).
二维互作图进一步揭示了药物与靶点之间的具体作用形式(图2B)。结果显示,配体的芳香环及杂环结构与 Phe315(A) 和 Ala458(A) 形成稳定的疏水驱动作用,同时部分含氧官能团与靶点中的极性残基(如Gly410)存在潜在的氢键或静电相互作用,结合距离在2.89~3.24 Å范围内。这些有利的非键相互作用构成药物稳定结合的重要贡献区,与模型注意力机制定位的“药效热点”高度吻合。此外,靶点周围多处疏水残基(如Leu314、Ala361、His411等)围绕配体形成疏水口袋,使整个结合腔呈现“夹持式”结构,有助于药物在结合位点实现稳固锚定。
总体而言,三维结构对接(图2A)与二维相互作用网络(图2B)在作用模式上保持一致,均显示候选药物通过芳香堆叠、疏水夹持以及局部氢键相互作用等方式与靶点形成稳定复合物。结合能结果也与KGNN预测的亲和力趋势一致,进一步验证了模型在药物–靶点互作建模中的可靠性。
2.5. 药物注意力权重可视化
为增强模型可解释性,本研究提取并可视化了模型内部的跨模态注意力权重矩阵,该矩阵量化了原子/基团对药物靶点相互作用预测的贡献,从而定位出驱动药物-靶点相互作用的“药效热点”。
在 KGNN 的交互层中,多头注意力机制动态计算了药物原子 与靶点蛋白残基 之间的关联权重 。权重值越高(接近 1.0),表明模型认为该原子在结合过程中起到的关键作用越大;反之,权重值越低(接近 0.0),则表明该区域对结合的贡献较小。为更加全面地评估模型对分子结构关键区域的识别能力,本研究将模型互注意力矩阵进行可视化,获取所有候选药物的原子级注意力权重并映射至二维分子结构中,并通过颜色梯度进行可视化展示。选取多种候选小分子进行展示(图3)。
图3.

药物注意力权重可视化图
Fig.3 Drug attention weight visualization. A-D: Atom-level attention weight distributions of 4 candidate drug molecules. The colors range from blue to red, representing attention weights from low to high. Red areas indicate key atoms or substructures that the model focuses on during the prediction of drug-target interactions.
从整体上看,不同分子的注意力分布均呈现出明显的非均匀性特征,但在关键结构识别上表现出一定的一致性规律:
2.5.1. 极性连接基团区域(如脲键或酰胺键)
在多个分子中,–NH–、C=O等极性官能团附近原子普遍表现出较高权重(图3A~C)。这些区域通常作为氢键供体或受体,在药物-蛋白结合中发挥关键作用,说明模型能够准确捕捉极性相互作用相关位点。
2.5.2. 芳香环及共轭结构区域
中心芳香环及其连接位点在多个分子中均表现出较高关注度。这些结构通常参与疏水作用或π-π堆积,是维持复合物稳定性的核心结构单元。
2.5.3. 杂环及含氮结构区域
部分含氮杂环区域(图3 A、C、D)呈现中等至较高权重,提示其可能通过配位作用或氢键网络参与靶点识别过程。
2.5.4. 外围取代基及柔性链段
相较之下,分子外围的烷基链或非极性取代基整体权重较低(蓝色区域为主),说明这些区域对直接结合贡献有限,更可能在分子构象调节或理化性质优化中发挥辅助作用。值得注意的是,尽管4种分子在结构上存在差异,但其高权重区域普遍集中在极性作用位点与芳香骨架,这一结果与已知小分子激酶抑制剂的作用机制一致。这表明 KGNN 模型能够在无需显式结构标注的情况下,自主学习到具有生物学意义的关键结构特征。
此外,相较于传统依赖经验规则的官能团分析方法,该原子级注意力可视化提供了一种可解释框架,不仅能够验证模型预测的合理性,还可辅助识别潜在的关键作用位点,为后续药物结构优化与理性设计提供数据驱动的依据。多分子层面的原子注意力分析进一步证明了 KGNN 在捕捉药物-靶点相互作用关键结构方面的有效性,并增强了模型在实际药物发现任务中的可解释性。
3. 讨论
本研究开发了一种KGNN模型,用于药物重定向预测,并应用于TNBC潜在治疗药物的识别与验证。该模型从药物分子结构和蛋白质序列的双模态视角出发,整合GNN、预训练蛋白质语言模型(ProtBERT)、多头注意力机制、门控融合模块以及PPI,实现了DTI的高分辨率特征表示。该设计不仅捕捉了分子拓扑和序列语义,还融入了生物网络先验知识,模拟了复杂的生物调控动态。
在BindingDB数据集上的基准实验验证了KGNN的优越性,其在均方误差(MSE=3.2697)、皮尔逊相关系数(PCC=0.8037)和一致性指数(CI=0.7862)等指标上均超越现有方法,如KronRLS、SimBoost、DeepDTA、FusionDTA和GraphDTA。这一性能提升突显了多模态融合策略在增强模型表示学习和泛化能力方面的效能。具体而言,传统模型依赖SMILES序列表示,忽略了药物空间结构信息,而KGNN通过GCN提取分子图特征,并结合ProtBERT的预训练知识和注意力机制建模互作依赖,进一步引入PPI图谱的门控融合,强化了生物学语义。该方法在生物信息学视角下,更符合DTI的网络调控本质,避免了单一模态的局限性。
消融实验进一步阐释了各模块的贡献:移除多头互注意力导致性能显著下降(MSE上升5.60%),证实其在捕捉药物-靶点动态关系中的核心作用;PPI模块的缺失(MSE上升10.82%)强调了外部知识图谱对缓解数据稀疏性的重要性。这些结果揭示了模型组件的协同效应,体现了人工智能算法在生物信息学中的模块化设计原则。
在冷启动场景下,KGNN于未见药物、未见靶点及双未见条件下维持稳定性能,验证了其在真实药物发现中的泛化潜力。该鲁棒性得益于预训练和注意力机制对未知实体的适应性,适用于生物信息学中常见的稀疏数据集挑战。以TNBC为例,本研究基于TCGA筛选的1340个致病靶点,利用KGNN预测候选药物,并通过分子对接确认预测与实验结合亲和力的一致性(相关系数>0.85)。此应用链条从计算预测延伸至体外验证,突显KGNN在多靶点疾病如TNBC的转化潜力。
此外,注意力权重可视化增强了模型的可解释性,直观揭示药物分子中的“药效热点”[31],如索拉非尼中酰胺键的高贡献区。该技术为后续分子优化提供了生物信息学指导,桥接AI算法与实验药物设计。
尽管取得一定研究进展,KGNN仍存在局限性。首先,模型依赖BindingDB等公开数据库的高质量配对数据,可能引入选择偏差或噪声;未整合三维结构(e.g., AlphaFold预测)或多组学特征(如转录组表达谱)限制了对动态互作机制的刻画。其次,当前聚焦静态亲和力预测,忽略动力学参数(如解离速率)和毒性评估,潜在地低估临床复杂性。最后,缺乏前瞻性临床样本验证,其在真实患者队列中的可转化性需进一步评估。
未来工作可扩展至融入多模态组学数据(如ChIP-seq或单细胞RNA-seq),提升对异质性疾病的预测精度;同时,优化计算效率以支持大规模筛选,并通过体外/体内实验验证临床效能。总之,KGNN在DTI预测中展现出优异的准确性、鲁棒性和可解释性,为TNBC等复杂疾病的药物重定向提供高效生物信息学工具,具有显著的学术和临床扩展价值。
基金资助
国家自然科学基金(3257071033);广东省自然科学基金(414050003969);广东省研究生教育创新计划项目(2024JGXM_029)
Supported by National Natural Science Foundation of China (3257071033).
参考文献
- 1. Bell CC, Gilan O. Principles and mechanisms of non-genetic resistance in cancer[J]. Br J Cancer, 2020, 122(4): 465-72. doi: 10.1038/s41416-019-0648-6 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 2. Persi E, Wolf YI, Horn D, et al. Mutation–selection balance and compensatory mechanisms in tumour evolution[J]. Nat Rev Genet, 2021, 22(4): 251-62. doi: 10.1038/s41576-020-00299-4 [DOI] [PubMed] [Google Scholar]
- 3. Lin A, Giuliano CJ, Palladino A, et al. Off-target toxicity is a common mechanism of action of cancer drugs undergoing clinical trials[J]. Sci Transl Med, 2019, 11(509): eaaw8412. doi: 10.1126/scitranslmed.aaw8412 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 4. Vasan N, Baselga J, Hyman DM. A view on drug resistance in cancer[J]. Nature, 2019, 575(7782): 299-309. doi: 10.1038/s41586-019-1730-1 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 5. Wang YP, Yin ZX. Drug-target interaction prediction through fine-grained selection and bidirectional random walk methodology[J]. Sci Rep, 2024, 14: 18104. doi: 10.1038/s41598-024-69186-w [DOI] [PMC free article] [PubMed] [Google Scholar]
- 6. Peng Y, Zhao SW, Zeng ZL, et al. LGBMDF: a cascade forest framework with LightGBM for predicting drug-target interactions[J]. Front Microbiol, 2023, 13: 1092467. doi: 10.3389/fmicb.2022.1092467 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 7. Hasan Mahmud SM, Chen WY, Liu YS, et al. PreDTIs: prediction of drug-target interactions based on multiple feature information using gradient boosting framework with data balancing and feature selection techniques[J]. Brief Bioinform, 2021, 22(5): bbab046. doi: 10.1093/bib/bbab046 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 8. Zagami P, Carey LA. Triple negative breast cancer: Pitfalls and progress[J]. npj Breast Cancer, 2022, 8: 95. doi: 10.1038/s41523-022-00468-0 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 9. Bai XP, Ni J, Beretov J, et al. Triple-negative breast cancer therapeutic resistance: Where is the Achilles' heel[J]? Cancer Lett, 2021, 497: 100-11. doi: 10.1016/j.canlet.2020.10.016 [DOI] [PubMed] [Google Scholar]
- 10. Gupta R, Srivastava D, Sahu M, et al. Artificial intelligence to deep learning: machine intelligence approach for drug discovery[J]. Mol Divers, 2021, 25(3): 1315-60. doi: 10.1007/s11030-021-10217-3 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 11. Liu TQ, Hwang L, Burley SK, et al. BindingDB in 2024: a FAIR knowledgebase of protein-small molecule binding data[J]. Nucleic Acids Res, 2025, 53(D1): D1633-44. doi: 10.1093/nar/gkae1075 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 12. Szklarczyk D, Kirsch R, Koutrouli M, et al. The STRING database in 2023: protein-protein association networks and functional enrichment analyses for any sequenced genome of interest[J]. Nucleic Acids Res, 2023, 51(D1): D638-46. doi: 10.1093/nar/gkac1000 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 13. Zheng QQ, Min SH, Zhou QH. Identification of potential diagnostic and prognostic biomarkers for LUAD based on TCGA and GEO databases[J]. Biosci Rep, 2021, 41(6): BSR20204370. doi: 10.1042/bsr20204370 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 14. Zhang H, Liu XQ, Cheng WY, et al. Prediction of drug-target binding affinity based on deep learning models[J]. Comput Biol Med, 2024, 174: 108435. doi: 10.1016/j.compbiomed.2024.108435 [DOI] [PubMed] [Google Scholar]
- 15. Zhu Y, Zhao LL, Wen NF, et al. DataDTA: a multi-feature and dual-interaction aggregation framework for drug-target binding affinity prediction[J]. Bioinformatics, 2023, 39(9): 560. doi: 10.1093/bioinformatics/btad560 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 16. Luo WF, Deng J, He JC, et al. Integration of molecular docking, molecular dynamics and network pharmacology to explore the multi-target pharmacology of fenugreek against diabetes[J]. J Cellular Molecular Medi, 2023, 27(14): 1959-74. doi: 10.1111/jcmm.17787 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 17. Zhao LH, Zhang ZX, Su HL, et al. Molecular docking-QSAR-Kronecker-regularized least squares-based multiple machine learning for assessment and prediction of PFAS-protein binding interactions[J]. J Hazard Mater, 2025, 492: 138069. doi: 10.1016/j.jhazmat.2025.138069 [DOI] [PubMed] [Google Scholar]
- 18. Tang XW, Zhou YQ, Yang MY, et al. TC-DTA: predicting drug-target binding affinity with transformer and convolutional neural networks[J]. IEEE Transon Nanobioscience, 2024, 23(4): 572-8. doi: 10.1109/tnb.2024.3441590 [DOI] [PubMed] [Google Scholar]
- 19. Nguyen T, Le H, Quinn TP, et al. GraphDTA: predicting drug-target binding affinity with graph neural networks[J]. Bioinformatics, 2021, 37(8): 1140-7. doi: 10.1093/bioinformatics/btaa921 [DOI] [PubMed] [Google Scholar]
- 20. Öztürk H, Özgür A, Ozkirimli E. DeepDTA: deep drug-target binding affinity prediction[J]. Bioinformatics, 2018, 34(17): i821-9. doi: 10.1093/bioinformatics/bty593 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 21. Yuan WN, Chen GX, Chen CY. FusionDTA: attention-based feature polymerizer and knowledge distillation for drug-target binding affinity prediction[J]. Brief Bioinform, 2022, 23: 506. doi: 10.1093/bib/bbab506 [DOI] [PubMed] [Google Scholar]
- 22. Zhang YQ, Zhu GC, Li KW, et al. HLAB: learning the BiLSTM features from the ProtBert-encoded proteins for the class I HLA-peptide binding prediction[J]. Brief Bioinform, 2022, 23(5): 173. doi: 10.1093/bib/bbac173 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 23. Mohamed SK, Nounu A, Nováček V. Biological applications of knowledge graph embedding models[J]. Brief Bioinform, 2021, 22(2): 1679-93. doi: 10.1093/bib/bbaa012 [DOI] [PubMed] [Google Scholar]
- 24. He HH, Chen GX, Tang ZC, et al. Dual modality feature fused neural network integrating binding site information for drug target affinity prediction[J]. npj Digit Med, 2025, 8: 67. doi: 10.1038/s41746-025-01464-x [DOI] [PMC free article] [PubMed] [Google Scholar]
- 25. Thafar MA, Alshahrani M, Albaradei S, et al. Affinity2Vec: drug-target binding affinity prediction through representation learning, graph mining, and machine learning[J]. Sci Rep, 2022, 12: 4751. doi: 10.1038/s41598-022-08787-9 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 26. Pu YQ, Li JW, Tang JJ, et al. DeepFusionDTA: drug-target binding affinity prediction with information fusion and hybrid deep-learning ensemble model[J]. IEEE/ACM Trans Comput Biol And Bioinf, 2022, 19(5): 2760-9. doi: 10.1109/tcbb.2021.3103966 [DOI] [PubMed] [Google Scholar]
- 27. Zeng X, Su GP, Li SJ, et al. Drug-Online: an online platform for drug-target interaction, affinity, and binding sites identification using deep learning[J]. BMC Bioinform, 2024, 25(1): 156. doi: 10.1186/s12859-024-05783-w [DOI] [PMC free article] [PubMed] [Google Scholar]
- 28. Zhang L, Wang CC, Chen X. Predicting drug-target binding affinity through molecule representation block based on multi-head attention and skip connection[J]. Brief Bioinform, 2022, 23(6): 468. doi: 10.1093/bib/bbac468 [DOI] [PubMed] [Google Scholar]
- 29. Wang JR, Xiao YH, Shang XQ, et al. Predicting drug-target binding affinity with cross-scale graph contrastive learning[J]. Brief Bioinform, 2023, 25: bbad516. doi: 10.1093/bib/bbad516 [DOI] [PMC free article] [PubMed] [Google Scholar]
- 30. Lu R, Wang J, Li P, et al. Improving drug-target affinity prediction via feature fusion and knowledge distillation[J]. Brief Bioinform, 2023, 24(3): 145. doi: 10.1093/bib/bbad145 [DOI] [PubMed] [Google Scholar]
- 31. Zhu ZQ, Yao Z, Zheng X, et al. Drug-target affinity prediction method based on multi-scale information interaction and graph optimization[J]. Comput Biol Med, 2023, 167: 107621. doi: 10.1016/j.compbiomed.2023.107621 [DOI] [PubMed] [Google Scholar]
