导读:

在汉斯出版社《计算生物学》期刊上,有文章提出了一种名为SSAL的深度学习模型,旨在实现大规模数据集上circRNA-RBP相互作用位点的精准预测。

作者信息:

刘 晨:大连交通大学理学院,辽宁 大连

论文详情

方法

SSAL 模型的总体架构如图 1 所示。

图片

本研究的实验数据源自 CircInteractome 数据库(URL: https://circinteractome.nia.nih.gov/)。

在处理后的 37 个数据集中,本文筛选出 14 个规模较大的数据集(样本量均超过 20,000 条)。这些数据最终用于评估本模型的性能,并与其他主流模型进行对比测试,这 14 个数据集的详细信息如表 1 所示。

图片

SSAL 模型基于 Python 3.8 和 PyTorch 1.11.0 框架实现,并在以下硬件配置上进行了训练: 

CPU:16 vCPU AMD EPYC 9654 96 核处理器 

GPU:NVIDIA GeForce RTX 4090 (24 GB) × 1

实验结果与分析

本文采用五项常用于评估环状 RNA-RBP 结合预测问题的指标:受试者工作特征曲线下面积(AUC)、准确率(ACC)、精确率(Precision)、召回率(Recall)以及 F1 分数。这些指标被用于全面评估 SSAL模型的性能。其具体定义如下

图片

为了评估 SSAL 模型在不同 circRNA-RBP 相互作用场景下的适用性与鲁棒性,本文在 14 个公开基准数据集上进行了 5 折交叉验证实验。实验数据汇总于表 2。

图片

结果表明,SSAL 在所有 14 个数据集上的 AUC 值均超过了 0.99,展现出卓越的排序能力且不依赖于分类阈值。

为了全面评估 SSAL 模型的预测性能,利用 5 折交叉验证,在 14 个大规模 circRNA 数据集上将 SSAL与五种最先进(State-of-the-art)的环状 RNA 结合位点预测模型进行了系统对比。

如图2和表3所示,SSAL模型在所有数据集上的表现均优于其他五种基准模型。

图片

图片

图 3 展示了 SSAL 模型与其各变体模型在 AUC 值上的对比。

图片

为了更直观地评估 SSAL 模型区分结合位点与非结合位点的能力,利用 t-分布邻域嵌入(t-SNE)算法,对 IGF2BP2 数据集的预测结果进行了可视化降维分析。如图 4 所示,将模型从 circRNA 序列空间和结构空间中学习到的联合特征表示映射到二维平面上,从而构建了一个统一的结合位点预测空间。图中红色点代表正样本(真实结合位点),蓝色点代表负样本(非结合位点)。

图片

结论和讨论

结果表明,SSAL 在预测准确性及其他评估指标上均优于现有的先进方法。实验结果充分证实了 SSAL 预测模型的高效性与鲁棒性。

尽管如此,SSAL 的性能仍存在进一步优化的空间。一方面,SSAL 目前使用 CDPfold 工具生成的碱基配对矩阵作为结构特征。近年来,RNA 结构信息的表征方法不断增加与优化,这意味着理论上可能存在更优的模型或方法能够更精确地捕捉 circRNA 的结构特征。另一方面,目前已知的 RBP 结合位点数据有限,可能导致数据集中正负样本分布不均,从而影响预测结果。因此,未来的研究可以通过收集更多关于 circRNA-RBP 相互作用位点的生物实验数据来扩充现有数据集,同时持续探索更合适的circRNA 结构表征方法,以进一步提升 SSAL 的预测性能。

基金项目:

辽宁省省属高校基本科研业务费专项资金(项目编号:LJ212410150016)

原文链接:

https://doi.org/10.12677/hjcb.2026.162006

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐