癌症早期诊断对提高治疗效果和患者生存率具有重要意义。血浆游离RNA(cell-free RNA,cfRNA)能够反映机体动态的基因表达状态,是液体活检的重要信息来源。然而,cfRNA本身具有短小、碎片化的特点,其测序数据不仅包含序列信息,不同读段的丰度也可反映相应RNA的表达水平。传统cfRNA分析通常依赖已有基因注释,将读段归属到已知基因后进行表达量分析,因此大量来自重复序列、非编码区域、基因间区域及其他未注释区域的潜在疾病信号容易被忽略。
近日,北京大学第一医院、北京航空航天大学等研究团队在《Nature Communications》发表了题为“Decoding cancer circulating transcriptomic signatures with language models”的文章,开发了一种专门面向cfRNA测序数据的语言模型——GeneLLM。与传统依赖基因表达矩阵的方法不同,GeneLLM直接建模比对至人类基因组的cfRNA读段,针对其短、碎片化、富含表达量信息和未注释区域信号等特点,构建了从原始读段到患者级疾病预测的端到端框架,以充分挖掘传统方法难以利用的癌症相关信息。
GeneLLM的模型框架主要包括四个步骤。首先,研究人员将cfRNA读段切分为7-mer片段,并通过Transformer进行无监督预训练,使模型先从海量短序列中学习cfRNA自身的序列规律,再将每条读段编码为特征向量。随后,为了从数千万条读段中提炼出具有代表性的模式,模型在特征空间中学习一组“伪生物标志物”,并根据不同读段与这些原型的相似程度进行软匹配。第三步,模型汇总同一患者全部读段对各伪标志物的匹配结果,将海量读段级信息压缩为患者级特征,同时保留读段丰度和覆盖度所反映的表达信息。最后,在校正不同医院来源带来的偏差并进一步提取多尺度特征后,分别由不同癌种预测头进行判断,最终输出癌症类型或非癌症结果。
研究共纳入来自三个医学中心的496例血浆样本,包括102例结直肠癌、102例胃癌、81例肝癌、47例肺癌以及164例非癌症对照。在332例癌症患者中,67.8%为I期或II期,因此该队列以早期癌症患者为主,可用于评估模型在早期肿瘤检测中的表现。在独立测试集中,GeneLLM对胃癌、结直肠癌、肝癌和肺癌的AUC分别达到0.996、0.986、0.924和0.993,泛癌检测AUC达到0.976,四种癌症的平均分类准确率约为83%,整体优于基于传统基因表达矩阵建立的SVM、RF、XGBoost和普通神经网络等方法。
GeneLLM在降低测序深度后仍表现出较高稳定性。常规cfRNA测序每个样本约产生6 GB数据、4000万条双端读段,而在仅1 GB/样本的真实浅测序条件下,肝癌、结直肠癌和肺癌的AUC仍分别达到0.9941、0.9653和0.9756,胃癌也达到0.9446;进一步将标准测序数据下采样至20%深度时,所有癌种AUC均保持在0.96以上。这表明GeneLLM能够在减少测序量的情况下保留主要诊断信息,为降低cfRNA液体活检的测序成本和计算负担提供了可能。
进一步分析显示,GeneLLM识别出的许多伪生物标志物并不来源于传统的蛋白编码基因,而是对应于未注释区域、基因间区域及重复序列等转录组“暗物质”。作者将1000个伪生物标志物按照是否来源于已注释基因区域进行区分后发现,仅使用非基因区域信号进行泛癌检测时AUC达到0.889,明显高于仅使用基因区域信号的0.792,说明传统注释流程中容易被忽视的区域实际上包含重要的癌症诊断信息。此外,不同癌种对应的伪生物标志物还呈现出较好的癌种特异性,例如胃癌相关标志物在胃癌样本中的得分更高,提示这些特征不仅可用于癌症检测,也有助于区分不同癌种的cfRNA特征模式。
该研究针对cfRNA短、碎片化、富含表达量信息和未注释区域信号的特点,建立了从原始读段到疾病判断的完整分析框架,突破了传统方法对基因注释和表达矩阵的依赖。模型在以I/II期患者为主的多癌种队列及低测序深度条件下均保持较高性能,为挖掘cfRNA“转录组暗物质”、降低液体活检测序成本和推动多癌种早期筛查提供了新的技术路径。
论文链接:
https://doi.org/10.1038/s41467-026-74411-3
注: 此研究成果摘自《Nature Communications》杂志,文章内容不代表本网站的观点和立场,仅供参考。