游乐游手机版
首页/AI热点日报/热点详情

哈佛医学院泛癌基础模型COMPASS超1万肿瘤样本训练优于22种方法

类型:热点整理2026-07-21
哈佛医学院等提出泛癌症基础模型COMPASS,基于33种癌症类型10184个肿瘤样本训练,在7种癌症16个免疫治疗队列中评估,平均性能优于22种现有方法,预测准确率提升8 5%,AUPRC提升15 7%,并具备跨癌种、跨治疗方案泛化能力。

哈佛医学院、罗氏制药和浙江大学的研究团队共同提出了一种泛癌症基础模型——COMPASS。这个模型基于来自33种癌症类型的10,184个肿瘤样本训练而成,并在7种癌症、6种免疫检查点抑制剂覆盖的16个临床队列中完成了评估。结果很说明问题:COMPASS的平均性能优于22种现有方法,在不同队列中平均将预测准确率提升了8.5%。

免疫检查点抑制剂在过去十多年里彻底改写了癌症治疗的格局,但一个现实问题始终存在——它并非对所有患者都有效。即便是接受同一种免疫检查点抑制剂治疗,不同患者之间的疗效差异也相当明显。一部分人可以获得长期缓解,而另一部分人几乎没有任何治疗响应。因此,提升免疫检查点抑制剂响应预测的能力,并搞清楚影响治疗响应与耐药的关键机制,对于指导个体化治疗和改善患者预后来说,至关重要。

目前,临床研究已经探索了不少预测免疫治疗疗效的生物标志物,其中肿瘤突变负荷(TMB)、程序性死亡配体1(PD-L1)免疫组织化学检测(IHC)等指标已经被用于部分临床决策。但这些指标仍然存在明显的局限性。随着高通量测序技术的发展,RNA测序(RNA-seq)提供了一种观察肿瘤免疫状态的新方式,但从数万个基因表达数据里真正找出与治疗响应相关的那几条规律,依然是巨大的挑战。

正是在这个背景下,哈佛医学院、罗氏制药和浙江大学的研究团队提出了COMPASS。这个模型基于来自33种癌症类型的10,184个肿瘤样本进行训练,并在7种癌症、6种免疫检查点抑制剂覆盖的16个临床队列中进行了评估。结果显示,COMPASS的平均性能优于22种现有方法,在不同队列中平均将预测准确率提升了8.5%,精确率-召回率曲线下面积(AUPRC)提升了15.7%。更关键的是,COMPASS还能泛化到微调阶段从未接触过的癌症类型和治疗方案,这意味着它有望用于辅助治疗适应症选择和患者分层。

相关研究成果以「Generalizable AI predicts immunotherapy outcomes across cancers and treatments」为题,发表在《Nature Medicine》上。

研究亮点

COMPASS利用概念瓶颈Transformer(concept bottleneck transformer),基于整体肿瘤转录组数据预测免疫治疗响应情况。

COMPASS通过44个具有生物学基础的免疫概念对基因表达进行编码,这些概念涵盖免疫细胞状态、肿瘤—微环境相互作用以及信号通路等关键生物过程。

COMPASS不仅能够预测免疫治疗响应,还能提供用于临床试验设计和转化医学研究的机制假设线索。

论文地址:https://www.nature.com/articles/s41591-026-04502-7

覆盖多癌种、多治疗方案的大规模数据集

为了建立真正具有泛化能力的模型,研究团队没有把目光局限在单一癌种或单一临床试验数据上,而是整合了多个公开数据库中的转录组数据和免疫治疗队列。

在模型预训练阶段,研究团队使用了癌症基因组图谱(TCGA)数据库中的泛癌种RNA测序数据。初始数据包含11,274个样本和60,660个基因,经过去除正常组织样本、去除既往接受治疗的样本、去除非福尔马林固定石蜡包埋(non-FFPE)样本等筛选步骤,并根据患者编号进行患者级别聚合,最终选择了15,672个蛋白编码基因作为模型输入。

随后,为了训练模型预测免疫治疗响应的能力,研究团队进一步收集了16个临床队列中1,133名患者的治疗前整体RNA测序数据(bulk RNA-seq)以及临床治疗结果。

临床队列概览(该数据集涵盖了不同规模的临床队列、患者癌症类型、药物治疗方案以及治疗响应结果)

这些队列覆盖了7种癌症类型,包括膀胱癌、肾透明细胞癌、黑色素瘤、肺腺癌、肺鳞癌、胃癌以及胶质母细胞瘤等。在治疗方案方面,数据涵盖多种免疫检查点抑制剂治疗方案,包括抗PD-1/PD-L1治疗、抗CTLA-4治疗以及联合治疗方案。

不同队列的规模从16名患者到298名患者不等。根据治疗结果,患者被分为两类:

响应者(responders):346人,占30.5%,包括完全缓解或部分缓解患者;

非响应者(non-responders):787人,占69.5%,包括疾病进展或疾病稳定患者。

这个数据集覆盖了不同癌症适应症、治疗方案、测序平台以及研究设计所带来的高度异质性。

COMPASS:一种能够跨癌种应用的基础模型

COMPASS是一种能够跨癌种应用的基础模型(pan-cancer foundation model),可以从转录组数据中学习具有可解释性的肿瘤—免疫概念(tumor-immune concepts)。它采用概念瓶颈架构,将患者的转录组数据通过一系列人类可以理解的生物学概念进行映射。举个例子,在视网膜影像分析领域,这类模型可以首先预测组织和病灶图谱,然后利用这些中间预测结果辅助诊断分流。

COMPASS模型由三个主要部分组成,整体架构如下图所示:

基因语言模型(Gene Language Model, GLM):作为模型的编码器,用于生成单个基因的上下文表征。

分层投影器(Hierarchical Projector):将基因层面的嵌入表示转换为高层次生物学概念,包括免疫细胞类型、信号通路等。

分类器(Classifier):基于概念表示完成免疫治疗响应预测。

COMPASS模型架构

①基于Transformer的基因语言模型

研究团队借鉴了自然语言处理领域Transformer架构的思路,把每一个基因视为一个“token”,通过模型学习不同基因之间的上下文关系。但这里有一个关键区别:语言中的词语有固定顺序,而基因表达数据本质上是无序的。因此,COMPASS引入了可学习的基因位置偏置,让模型能够根据训练数据自动学习不同基因之间的潜在关联。

②基于概念的分层投影器

COMPASS遵循概念瓶颈(concept bottleneck)范式。在这个范式中,输入数据并不是直接从潜在特征映射到预测结果,而是先经过一层人类可理解的概念层。COMPASS是第一个将这一架构引入癌症转录组分析领域的模型,它通过利用免疫相关基因集,建立了基因→基因集→概念的层级映射关系,用于表征每位患者的肿瘤免疫微环境。

③预测模块

COMPASS利用这些免疫概念特征,对患者接受免疫治疗后的响应概率进行预测。同时,模型支持多种适配方式,包括无需重新训练的零样本预测(NFT)、仅调整分类层的轻量微调(LFT)、部分参数微调(PFT)以及全模型微调(FFT)。

除此之外,研究团队还提出了多阶段微调策略(Multi-stage Fine-tuning, MSFT)。这个方法先利用泛癌免疫治疗数据学习通用免疫响应规律,再针对具体药物或癌症类型进行进一步优化,从而提升模型在新治疗场景中的预测能力。

COMPASS在跨癌种、跨药物预测中展现优势

多项研究结果显示,COMPASS在多个测试场景中均表现出了较强的预测能力。

1. COMPASS在16个免疫治疗队列中实现领先预测性能

面对16个临床队列,研究人员将COMPASS与22种广泛应用于ICI响应预测的方法进行了比较。这些方法包括单基因预测模型、免疫特征评分方法,以及基于网络和机器学习的预测模型。评估指标包括准确率、精确率-召回率曲线下面积(AUPRC)、ROC曲线下面积(AUROC)和Matthews相关系数(MCC)。

*准确率(accuracy, %)结果和精确率-召回率曲线下面积(AUPRC)结果*

从上图可以清楚看到,COMPASS在所有队列规模和评价指标中均显著优于现有的ICI响应预测方法。其中,部分微调模式(COMPASS-PFT)和线性探测模式(COMPASS-LFT) consistently取得了最高的整体预测性能。

与排名第二的方法相比:

COMPASS-PFT和COMPASS-LFT平均提升了8.5%的准确率;

平均提升了15.7%的AUPRC;

平均提升了12.3%的MCC指标。

这些结果充分证明,COMPASS在免疫治疗响应预测方面具有更强的预测能力。无论面对大型、中型还是小型临床队列,模型性能都保持稳定,其中COMPASS-PFT和COMPASS-LFT在不同应用场景下都展现出了持续优异的表现。

2. COMPASS在免疫治疗队列内部及跨队列中均具备泛化能力

研究人员进一步评估了在训练数据仅来自单一队列的情况下,COMPASS预测免疫治疗响应的准确性。研究采用了两种基准评估策略:队列内部留一患者验证(intra-cohort lea ve-one-patient-out validation)和跨研究队列迁移预测(cohort-to-cohort transfer across studies)。

在队列内部验证中,COMPASS在所有队列中均取得了最佳平均性能。不过,模型表现会因具体应用场景而有所差异,在部分队列和精确率-召回率比较中,已有方法仍然优于COMPASS。其中,COMPASS-PFT、COMPASS-LFT和COMPASS-FFT在中型和大型队列中取得了最高准确率;对于小型队列(患者数量少于30人),无需微调版本(COMPASS-NFT)表现最佳。

COMPASS患者表征学习策略基准评估

在跨队列迁移分析中,研究人员使用基于一个队列训练的模型,预测另一个不同队列中的治疗响应情况,共完成了240次两两队列迁移评估。结果显示:COMPASS-LFT表现最佳,在240次迁移任务中成功完成了163次模型迁移;其次是COMPASS-PFT,成功完成了155次模型迁移。这一表现明显优于此前发表的最佳方法,包括PGM(130/240次成功迁移)、Teff(118/240次成功迁移)和NetBio(117/240次成功迁移)。整体预测准确率和AUPRC结果如下图所示:

*240次独立跨队列迁移任务中的平均准确率以及平均AUPRC表现*

3. COMPASS在跨治疗方案预测中展现出较强能力

在跨适应症预测任务中,COMPASS-PFT能够识别训练数据中未包含的癌症类型中的治疗响应患者。举例来说,当训练数据中排除肺腺癌(LUAD)后,COMPASS-PFT仍然能够在独立测试队列中达到76.5%的预测准确率。这一结果表明,COMPASS能够识别抗肿瘤免疫过程中具有普适性的关键特征,而不是仅仅捕获某一种癌症类型特异性的转录变化。

*模型在不同生物学场景下的泛化能力评估(跨疾病类型泛化)*

在跨治疗方案和跨免疫检查点靶点评估中,COMPASS-PFT同样表现出良好的泛化能力。例如,当模型仅利用抗PD-1/PD-L1治疗队列进行训练时,COMPASS-PFT仍然能够预测抗CTLA-4治疗患者的响应情况,并达到70.8%的准确率。这个结果提示,不同免疫检查点治疗之间可能存在共享的免疫作用机制,而COMPASS能够捕获这些共性特征。

*模型在不同生物学场景下的泛化能力评估(跨治疗方案泛化和跨靶点泛化)*

研究还进一步测试了模型在不同技术因素下的泛化能力,结果显示:COMPASS-PFT保持了稳定的性能,而基于基因特征签名的方法则容易受到测序平台和样本来源差异的影响。这表明,COMPASS不仅能够适应复杂的临床异质性,同时具备更强的跨技术条件泛化能力。

结语

如今,免疫治疗的发展正在进入一个更加精准化的新阶段。过去,临床研究更多依赖单一指标来判断患者是否可能获益,比如PD-L1表达水平或TMB,但肿瘤免疫系统本身是一个高度复杂的动态网络,仅靠单一指标很难完整描述患者的真实免疫状态。COMPASS提供了一种新的思路:通过人工智能从大规模转录组数据中学习复杂的免疫模式,并将这些模式转化为可解释的生物学概念。

当然,研究团队也明确指出,COMPASS目前仍属于探索性工具。由于模型依赖bulk RNA-seq数据,其空间分辨能力有限,部分低丰度免疫细胞信号可能被掩盖。同时,这个模型还需要更多前瞻性临床试验验证,才能真正进入临床决策体系。但从技术发展趋势来看,COMPASS代表了一个重要方向——未来的医疗AI不应只是提高预测准确率,更需要帮助医生理解疾病机制,并为个体化治疗提供更加透明、可靠的依据。

参考文献:https://www.nature.com/articles/s41591-026-04502-7

来源:https://36kr.com/p/3903912488502920

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。