Token导航 LogoToken导航TokenDH.com

2396名患者/4类数据/2条AI路线,I³LUNG联盟用多模态AI探索肺癌免疫治疗决策,表现超越PD-L1等传统指标

更新时间 2026-09-17来源 超神经HyperAI正文 6878字阅读约 22分钟9 张图片
图片

作者:哇塞

编辑:李宝珠

转载请联系本公众号获得授权,并标明来源

国际多中心 I³LUNG 联盟首次介绍其人工智能临床决策支持系统(PDSS)回顾性队列的阶段性研究成果。研究基于 2,396 名晚期 NSCLC 患者数据,提出一套基于临床-血液数据(CB)与多模态的个性化治疗选择分析框架。

免疫治疗是一种调动患者自身免疫系统抵抗癌细胞的癌症治疗手段,尤其对非小细胞肺癌(NSCLC)治疗而言,是当前治疗效果显著、患者获益突出的基础方案。然而,并非所有患者都适用于免疫治疗。统计显示,仅 20%-30% 的患者能够从中长期获益,绝大多数患者仍会面临耐药问题(原发性耐药 5%-20%;继发性耐药高达 60%-85%),最终治疗失败。因此,初诊阶段筛选适合免疫治疗的患者具有重要临床价值。

目前,PD-L1(Programmed Death Ligand 1)是唯一获批用于临床疗效预测的生物标志物,但该指标的预测效能并不理想。相比之下,人工智能有望借助大规模、多维度真实世界数据,实现 NSCLC 免疫治疗的个体化疗效精准预测,是弥补传统生物标志物手段短板极具潜力的研究方向。但不足的是,既往无论是单模态研究还是多模态研究多存在样本与设计局限,如多为单中心研究、研究范围窄、样本规模偏小等。

针对紧迫的临床需求和亟待改善的 AI 方法,来自欧洲、美国、以色列共六家临床中心,联合米兰理工大学、奥尔堡大学等科研机构组成的国际多中心 I³LUNG 联盟,依据项目正在开展的回顾性与前瞻性数据体系,首次介绍了其人工智能临床决策支持系统(PDSS)回顾性队列的阶段性研究成果(前瞻性队列仍在招募)。

该研究基于 2012 年 9 月至 2023 年 10 月间接受免疫治疗的晚期 NSCLC 患者的数据,提出一套基于临床-血液数据(CB)与多模态的个性化治疗选择分析框架:包含医学图像基础模型特征提取、早期融合(MLEF)与中间融合(DLIF)模型对比评估、可解释性与公平性分析,同时开展临床可用性研究评估工具现实临床价值。

实验显示,在内部测试集中,仅基于 CB 数据的模型在各项指标上均能表现出良好性能,曲线下面积(AUC)最高可达 0.77,不过在外部验证中性能略有下降;在内部测试集中,AI 模型展现出显著优于传统指标和评分的预测性能。同时在临床可用性研究中,在 AI 工具的帮助下,无论是胸肺专家还是非专家医生的临床预测能力均得到显著提升。

相关成果以「Clinical usability of an explainable AI decision support tool and evaluation of multimodal models in NSCLC」为题,发表于 Nature Medicine。

研究亮点:
* 建立国际多中心大样本晚期肺癌多模态真实世界队列,包含 2396 例患者,用于免疫治疗 AI 预测研究 

* 仅基于常规血液临床数据的 AI 模型,内部测试集预测效果已优于 PD-L1 等传统临床标志物,更便于临床转化
* 可解释人工智能决策支持工具能够有效辅助临床医生预判免疫治疗疗效,有望提升基层医师应对医疗现场的能力

图片

论文地址:
https://www.nature.com/articles/s41591-026-04488-2

覆盖欧盟内外 6 大临床中心,统计近 2400 例真实患者数据

为解决以往基于人工智能方法研究的弊端,本研究依托 I³LUNG 联盟构建了目前规模最大的国际真实世界多模态人工智能研究数据集。

研究纳入了 2012 年 9 月至 2023 年 10 月间接受免疫治疗的 2,396 名 IIIC 至 IVB 期非小细胞肺癌患者,这些患者来自意大利国家癌症研究所(意大利 INT)、希腊大都会医院(希腊 MH)、德国格罗斯汉斯多夫肺病诊所(德国 GHD)、西班牙瓦尔德赫布隆肿瘤研究所(西班牙 VHIO)、美国芝加哥大学(芝加哥大学 UOC)和以色列沙雷泽德科医疗中心(以色列 SZMC)等欧盟内外六个临床中心,年龄均在 18 岁及以上。

根据疾病分期,研究人员进一步将患者分为了三个队列:C1 为接受根治性化疗放疗并随后进行维持性免疫治疗的 III 期非小细胞肺癌患者;C2 为包括接受一线免疫治疗,无论单独使用或化疗或其他治疗药物联合使用的晚期或转移性非小细胞肺癌患者;C3 为包括二线及后线免疫治疗的晚期或转移性非小细胞肺癌患者。

核心预测 AI 模型基于合并队列 C23 (其中共 400 名患者可获得 CB 和两种影像学模式的数据,339 名患者具备四种影像学模式的全部数据,如下图 b)构建,C2=1437,C3=638,合计 2075 例;其中来自 UOC 中心的 251 例作为 EXVAL 外部验证集,用于检验模型泛化能力,剩余 1824 例按照 85%(1550 例)和 15%(274 例)划分为训练集(五折交叉验证)和 TEST 独立测试集。

图片
数据集说明 / C23 队列模态概览

数据集包含四类数据模态,包括临床-血液(CB)数据、CT 影像、数字病理切片(DP)和基因组学信息,具体来看:

CB 数据取自 I³LUNG 平台中电子病历报告表单,研究人员从中提取超 11,000 个特征,并对这些特征按照基线特征和治疗相关特征分为两类。经过两组独立盲法肿瘤科医生进行特征审查和筛选后,选定出共计 227 个特征。这些基线化疗特征进一步按照描述性特征和预测性特征划分为两类,前组用于探索性分析和子模型开发,后组用于模型训练。之后,经由经验丰富的肿瘤科专家完成最终收敛,确定出 9 项 CB 特征用于模型开发,包括性别、Eastern Cooperative Oncology Group performance status(ECOG PS)评分、吸烟状况、PD-L1 表达水平、骨 / 肝 / 脑转移状况、中性粒细胞与淋巴细胞比值(NLR) 和 乳酸脱氢酶(LDH)。

CT 扫描采用国际标准的医学数字成像与通信(DICOM)格式采集,共采集了 896 例患者的数据,其中 758 例为增强扫描,138 例采用非增强扫描。CT 扫描使用 PyRadiomics(PYRAD)和基础模型(FMRAD)两种特征模式并行分析,前者经过轮廓扰动稳定性筛选后得到 128 个稳健的影像组学特征;后者为专为癌症影像生物标志物发现而开发的领域特定基础模型,在包含 11,467 个放射学病灶的数据集上进行对比学习预训练。

DP 数据共收集了来自五个机构的 998 张组织病理学切片,其中 117 张来自 GHD,364 张来自 INT,81 张来自 MH,147 张来自 SZMC,191 张来自 UOC。经过质量(如组织不足、物理损伤、染色质量差等原因)筛查后,剔除了其中 64 张切片。为识别肿瘤区域,研究人员使用癌症基因组图谱(TCGA)数据集训练了一个分割模型,在 20 倍放大条件下取块,采用 Reinhard 归一化处理,随后通过 Prov-GigaPath 预训练切片基础模型对每个切片编码,并重新用多模态全切片基础模型 TITAN 提取 768 维特征进行复现验证。

为将基因组数据纳入模型评估,研究人员首先确定了与非小细胞肺癌相关的若干核心驱动基因,包括 KRAS、TP53、STK11、ALK、EGFR、 RET 和 ROS1。然后通过 ClinVar、Cancer Hotspot 和 OncoKB 三个数据库对致病性突变进行注释和交叉判定,并说明至少两个数据库一致才判定该变异具备致病性。同时,对 KRAS、TP53、STK11 单独编码,把 EGFR、ALK、ROS1 和 RET 合并成一个复合驱动特征「driver」,降低缺失值,用于免疫治疗结局建模。

除此之外,研究人员还额外增设了四个非 IO 对照队列,用于检验仅用 CB 的机器学习模型是否具有免疫治疗特异性预测能力,其中三个不属于 I³LUNG 研究,包括接受 EGFR 酪氨酸激酶抑制剂(TKIs)治疗的 EGFR 突变患者队列(C-EGFR-INT,n=132 和 C-EGFR-UOC,n=139),以及在 INT 中心接受化疗和手术的 III 期患者队列(C-StageIII-CHT,n=91),还有在 INT 中心接受一线化疗的 C3 组数据(C-LineI-CHT,n=208)。

提出 MLEF 和 DLIF 双 AI 对照路线

研究采用了两种人工智能方法用于 CB 模型的开发和多模态融合:MLEF 和 DLIF 模型。两种方法的数据预处理和分析流程完全相同。

图片
研究总体概况

首先对于 MLEF 机器学习早期融合模型,其原理是把不同模态提取好的特征直接拼接后送入传统机器学习。本研究评估了两种机器学习分类器,分别是逻辑回归(LR)和随机森林(RF)。调参方式通过贝叶斯优化,以最大化 AUC 为目标挑选最优超参数,然后基于交叉验证 AUC 选出最优 MLEF 分离模型。

训练与验证规则方面,模型仅在训练集上训练,采用留一中心交叉验证(LOCO),训练完成后直接在 TEST 测试集和 EXVAL 外部验证集测试,采用固定决策阈值 0.5,无需重新调整分类阈值。所有模型性能指标均附带 95% 置信区间,模型间 AUC 的比较采用 DeLong 检验。

值得注意的是,由于 MLEF 分析流程无法处理存在模态数据缺失的患者,因此所有多模态模型都会剔除这类患者。同时为保证研究透明性,每种 MLEF 多模态模型在报告时,都会同时列出本次分析纳入的患者数量以及该分析下的最优模型;并且采用同一批患者子集,与单模态、仅用临床-血液数据(CB-only)的匹配模型做对照比较。

其次对于 DLIF 深度学习中间融合模型,核心目的是解决多模态数据普遍存在的模态缺失难题。模型架构采用基于注意力机制的多实例学习(MIL)的监督式中间融合流水线,同时支持分类和生存预测任务,可以整合 CB、DP、RAD 和基因组信息这四类数据。

其中,MIL 把单个患者表达成一组向量包,每个患者包内实例数量可变,该设计天然适配 I³LUNG 这类只有少数患者拥有全套多模态数据的肿瘤真实世界数据集。另外训练策略上,每个模态配备独立编码器,把不同类型数据映射到同一个共享嵌入空间,在训练过程中引入跨模态重建损失,让不同模态学到的隐层表征保持一致性、可解释性。

另外为预测总生存期(OS)结局,研究还构建 Cox 模型在内的生存模型,同时采用多项终点指标,包括界标终点 OS6(是否生存 ≥ 6 个月)、OS24(是否生存 ≥ 24 个月)、疾病控制率(DCR),以及用于生存分析的总生存期(OS)。次要终点指标还包括临床获益率(CBR)和总体缓解率(ORR)。

具体来说,研究人员在生存分析中采用 Cox 比例风险模型作为基线模型,使用 Python 中的 lifelines 包实现。同时还评估了两种机器学习生存模型:随机生存森林(RSF)和梯度提升生存模型(GBS),这些模型基于 scikit-survival 库构建。由于各模型间未观察到性能差异,故本研究所有生存分析结构均采用 Cox 模型的输出为准。

AI 模型显示超越传统标志物的优势,XAI 有望叩响真实临床应用大门

由于 MLEF 工作流程需要所有模态数据齐全,为保证对比公平,研究人员在同一批患者子集上,将多模态 MLEF 与仅用临床基线数据的 CB-only 模型进行了对比。

结果显示,在 C23 队列中, CB-only 模型的主要分析在 CV 中各终点上均表现出稳健的基础性能,如下图所示。具体来看,在 OS24 上测试集 AUC 为 0.74(n=226;95% CI:0.67-0.81) ,外部验证集为 0.60(n=190;95% CI:0.52-0.72);在 OS6 上测试集 AUC 为 0.69(n=259;95% CI:0.62-0.76),外部验证集为 0.64(n= 240;95% CI: 0.56–0.72);在 DCR 上测试集 AUC 为 0.71(n= 273;95% CI: 0.65–0.77),外部测试集为 0.55(n= 251;95% CI: 0.48–0.62)

图片
MLEF 框架

在各检测方法的单模态贡献方面, FMRAD 贡献最大。

由于独立测试集样本量较小,因此研究人员对多模态 MLEF 模型的对比分析主要基于交叉验证 CV 开展。

结果显示(如下图),在 C23 队列中,用于预测 OS24 时,采用 CB、DP 和 CT(PYRAD)联合多模态组合相比仅使用 CB 匹配模型的性能有明显提升,AUC 为 0.72 (95% CI:0.64–0.80),相比之下仅使用 CB 的 AUC 为 0.60(95% CI:0.51–0.69);若用 FMRAD 特征代替 PYRAD,多模态模型的性能也优于仅使用 CB 的模型,DCR AUC 可从 0.63(95% CI:0.56–0.70)提升到 0.77(95% CI:0.71–0.83)。在一线 IO 治疗中,多模态组合相较于仅使用 CB 的模型也表现出更高的验证 AUC 值,如 OS24 上为 0.88(95% CI:0.82–0.94)对 0.68(95% CI:0.58–0.78),DCR 上为 0.81(95% CI:0.75–0.87)对 0.63(95% CI:0.55–0.71)。

图片
MLEF 单模态、双模态和多模态模型对三个终点的分类性能

不过研究同时指出,在独立的 TEST 队列中,这些多模态增益并未能一致复现,在外部验证集中表现并不稳定。

此外研究发现,仅使用深度学习(DL)模型在性能上与机器学习(ML)相当,这意味着 DLIF 方法并不因其多模态而获得更多收益,且这一结果在所有终点指标及亚组分析中均保持一致。

具体来看(如下图),在 OS24 的测试集中,AUC 为0.73(95% CI: 0.66–0.80),在外部验证集中为 0.63(95% CI: 0.55–0.71);在 OS6 的测试集中 AUC 为 0.72(95% CI: 0.65–0.79),在外部验证集中为 0.72(95% CI: 0.64–0.80);在 DCR 中 AUC 为 0.70(95% CI: 0.64–0.76)和 0.65(95% CI: 0.58–0.72)

图片
图片
DLIF 架构图及 C23 单模态、双模态和多模态 DLIF 模型在 CV 上的分类性能

在 C23 的测试中,若预测终点为 OS24,MLEF 和 DLIF 仅使用 CB 模型且未遗漏生物标志物时,这些 AI 模型的表现均优于单一传统生物标志物。具体来说,PD-L1(ML 和 DL 及单个生物标志物的 AUC 分别为 0.74、0.73 和0.53)、ECOG PS(0.75、0.74 和 0.62)、LDH(0.75、0.73 和 0.58)以及 NLR(0.76、0.76 和 0.66)。

就模型公平性评估结果来看,机器学习 CB-only 模型的公平性评估显示,各中心之间的敏感性存在差异,如下图。

图片

CB-only 机器学习模型的公平性与可解释性 AI 分析

具体来看,以临床中心作为保护属性(TEST 集),MH 中心亚组在 OS6 预测方面灵敏度(TPR=0.96)显著高于其他中心;DCR 指标上 MH 灵敏度为 0.96,显著高于 INT 中心的 0.63。换作性别作为保护属性,不同性别分组下,模型灵敏度不存在统计学差异,性别层面显示预测灵敏度是公平的。同样 EXVAL 中,分类模型在不同自报种族、不同性别上表现一致,无显著差别。

关于可解释 AI 分析结果,在各终点分析中,ECOG PS > 0、合并骨 / 肝 / 脑转移,是预测患者 24 个月总生存最稳定的强不良预后因素;NLR 也被确认为对 OS24 及 OS 分析具有重要意义,高 LDH 水平则主要影响 DCR 非应答者的预测结果。

最后,为求证机器学习 CB-only 基线模型的临床价值,研究人员开展了一项临床可用性研究。研究纳入 20 名医生——10 名肺癌专科肿瘤专家和 10 名非肺癌专家,以配对形式参与。每位医生需对 TEST 集中的 10 例真实病历进行评估,共计 200 次评估,如下图。



CB-only 模型的临床可用性

结果显示,在 DCR 预测中,医生与可解释 AI (XAI)的协作使所有医生的敏感性从 0.72(95% CI: 0.64–0.80)提升到了 0.87(95% CI: 0.79–0.92),准确率从 0.57 提高到了 0.65,不过特异性略有下降。专家的敏感性从 0.68 提升到了 0.83;非专家的敏感性则从 0.77 提升到了 0.90。总体来看,使用 XAI 使医生正确预测 DCR 的准确率提高了 37%,同样非专家和专家的正确 DCR 预测准确率分别提升了 53% 和23%。

在 OS 预测任务中,使用 XAI 使所有医生的正确预测概率提高了 36%(专家为 14%,非专家为 61%)。所有医生的总分提高了 4.5%,非专家提高了 6.5%,专家提高了 2.5%。在第一阶段,使用 XAI 后医生评分与真实 OS 一致的比例从 16.5% 上升到了 22.5%。专家与非专家之间的一致性也从轻微提升到良好水平,由 0.14 提升到 0.34。

写在最后

论文的最后,作者团队毅然承认了本研究虽存在诸多局限,比如回顾性设计以及真实世界数据的异质性可能影响模型性能,完整多模态病例数量相对较少,从而限制了多模态分析的可靠性,等等。

但尽管如此,这项研究依然让我们看到了诸多开创性的意义。或许正如芝加哥大学医学中心胸外科肿瘤学家、医学教授兼本研究的资深作者 Marina Garassino 博士所言,该研究为胸部肿瘤领域的人工智能应用树立了新标杆,对患者而言,意味着更少错失获得治疗获益的机会;对基层医生来说,代表着在诊疗现场就能获得专家级指导;而就本领域而论,预示着下一代精准免疫治疗的全球性平台即将诞生。

文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多