您好,欢迎您

AI 增强肿瘤临床试验:从患者匹配到数字孪生的全生命周期展望

08月27日
编译:肿瘤资讯
来源:肿瘤资讯

肿瘤临床试验长期面临入组缓慢、失败率高、真实世界代表性不足等结构性低效。人工智能(AI)——依托大规模电子健康档案(EHR)数据集与机器学习(ML)方法——为改善试验设计、执行与推断提供了全生命周期工具。


这篇发表在 2026 年《Nature Reviews Clinical Oncology》上的一篇综述,由意大利 Istituto Nazionale dei Tumori、荷兰 University Medical Center Groningen、美国 Emory University、瑞典 Karolinska Institute 等十余家机构的 18 位作者共同撰写(共同通讯为 Arsela Prelaj 与 Ravi B. Parikh)。


该文系统综述了试验前设计、试验中执行、试验后推断与推广三阶段的 AI 应用现状与证据成熟度,指出:患者-试验匹配、自动入组资格筛查及 EHR 结构化提取等操作自动化应用证据最充分、落地最快;而以合成对照臂、结局预测模拟和数字孪生为代表的证据生成替代方案仍处于早期验证阶段,面临方法学与监管挑战。未来需通过严格前瞻性验证、协调监管标准及多方协作,推动 AI 负责任地融入肿瘤临床试验工作流。


20260827-162120.jpg

一、研究背景:肿瘤临床试验的系统性低效

尽管肿瘤药物研发投入巨大,但仅约 5% 进入 I 期临床试验的肿瘤产品最终获得监管批准,且 II 期至 III 期之间损耗尤高。当代肿瘤临床试验仍被显著的操作低效困扰:患者入组缓慢、招募延迟、监管复杂性增加、真实世界代表性受限。

导致低成功率的根源包括:碎片化临床数据导致合格候选者识别困难;针对特定分子靶点的窄人群预筛选产生高筛败率;未能充分考虑真实世界人群的临床异质性;试验设计效力不足;以及频繁方案修订。这些局限造成患者获得有效治疗延迟、暴露于无效治疗,并导致特定人群(如老年患者、合并症患者)代表性不足。

AI 优化试验设计、执行与分析的潜力由三大并行进展支撑:(1)数据可用性空前提升——EHR、癌症登记库与理赔数据库可捕获纵向患者轨迹;(2)计算能力进步——现代 ML 架构可建模高维临床、基因组与影像数据中的复杂模式;(3)大语言模型(LLM)兴起——可从非结构化临床文本(病程记录、病理报告、放射学叙述)中系统提取结构化信息,解锁此前无法大规模分析的数据。
20260827-160339.jpg

原文 Figure 1:AI 在肿瘤临床试验全生命周期中的应用图谱。试验前应用包括中心可行性评估与选择、入组标准优化、方案制定、合成数据与对照臂生成、试验结局预测与模拟;试验中操作包括患者-试验匹配、自动入组资格验证、适应性剂量优化、EHR 数据提取与结构化、远程患者监测、响应适应性随机化;试验后推断与推广包括试验结果普适性评估、目标人群试验模拟、数字孪生模拟。

二、AI 分类学:四类应用与证据标准

鉴于不同 AI 应用所需的证据强度、风险与监管要求并不相同,作者采用明确的分类体系(原文 Table 1),将 AI 应用分为四类:

20260827-160446.jpg

三、试验前设计:优化可行性与方案质量

1. 中心可行性与选择

传统可行性评估依赖回顾性筛选日志或研究者估算,可能导致试验在入组潜力不足的中心启动。ML 算法可通过分析当地人口学与疾病流行病学数据、研究者经验、中心基础设施及历史招募数据,预测单个中心的招募潜力。例如,使用增强神经网络(BNNs)的研究发现,保险状态、职业分类与就业状况等社会经济因素是少数族裔患者参与度的最有影响力决定因素。

深度学习模型 DeepTrial 利用概率层估计中心级入组并给出不确定性区间,提高招募数量与持续时间预测的准确性。多 AI 平台结合 TOPSIS(逼近理想解排序法)与模拟退火,可在招募速度与患者多样性之间优化中心组合。此外,AI 驱动的地理空间分析可识别癌症发病率高但试验可及性有限的区域——美国和欧盟大量癌症高发县/地区尚无活跃肿瘤试验中心。智能覆盖分析工具(iCAT)整合地理信息系统与公开医疗数据,为识别区域诊疗缺口提供了概念验证。

2. 入组标准优化

AI 框架可利用真实世界数据(RWD)回顾性模拟试验,比较真实世界队列与原试验人群结局,以识别对疗效影响最小的限制性入组标准并予以放宽。最初在晚期非小细胞肺癌(NSCLC)中验证的 Trial Pathfinder 平台表明,放宽部分实验室阈值(如总胆红素、血红蛋白、碱性磷酸酶水平及血小板计数)可在对生存结局影响极小的前提下大幅扩大试验资格。

在血液肿瘤领域,将 AI pathfinder 方法回顾性应用于复发/难治性多发性骨髓瘤试验发现,放宽两项入组标准即可显著扩大合格人群且对无进展生存期(PFS)风险比影响甚微。此外,AutoTrial 框架利用 LLM 与少样本提示(few-shot prompting)生成既符合医学标准又提升可行性的入组标准。放宽资格对公平性与临床相关性有重要意义:许多排除标准仅凭惯例而非强有力经验证据,不成比例地排除了老年患者、合并症患者及既往多线治疗者——而这些人群可占真实世界肿瘤患者的高达 50%。

3. AI 辅助方案制定


跨医学全领域,>40% 的试验方案包含重大设计缺陷,57% 需要至少一次实质性修订(平均 2 次,近一半被认为可避免),延长试验时间平均 3–4 个月。LLM 可在试验规划早期改善一致性并识别设计缺陷。预印本报道已使用微调 LLM 工具从结构化输入(终点、定义人群、干预措施)生成方案初稿。

在主方案(master protocol)框架下,AI 的应用更具操作性:随着新臂或新篮的添加起草子方案、在平行分子定义亚组间统一入组逻辑、在需正式修订前标记不一致性。已有同行评议证据表明,LLM 工具在起草效率方面具前景,但在临床思维与逻辑方面表现尚 modest,透明度有限,仍需大量人工监督。

4. 合成数据与合成对照臂


传统随机对照试验(RCT)依赖同期对照臂建立相对疗效,但日益窄的分子定义人群使对照臂入组困难。外对照臂(ECAs)从试验外部来源(历史试验、EHR 登记库、理赔数据库)获取患者个体数据;完全合成对照臂则完全依赖 AI 生成的模拟个体数据。

基于 RWD 的 ECAs 在监管环境中更为成熟,已被用作单臂肿瘤试验监管申报的支持性证据。因果推断方法(如 G-计算、双重去偏 ML、因果森林)可改善估计准确性并提高统计效能,但面临未测量混杂、结局测量方式差异及时间漂移(治疗标准演进使历史对照可靠性下降)等风险。在 FDA 2015–2020 年间 133 项原始及 573 项补充肿瘤批准中,13 项纳入了真实世界证据作为外对照,主要为血液肿瘤及罕见肿瘤类型。

完全合成对照臂仍处于实验阶段。条件生成对抗网络(GANs)与分类回归树(CART)已能合成紧密复现源人群生存分布的队列,但存在校准失败与生成模型学习历史成功模式而非药物疗效因果决定因素的风险。此外,合成数据集面临可量化的再识别风险,易受关联攻击暴露源患者。

5. 试验结局预测与模拟


AI 驱动的计算模型可在入组前评估候选方案,预测“操作成功”(能否按计划完成入组)与“临床成功”(能否在主要终点获得统计学显著结果)。PyTrial 框架中,分层交互网络(HINT)预测 III 期试验结局的 F1 分数达 0.847;序列预测临床结局模型(SPOT)较前方法将 I 期试验预测精确-召回曲线下面积(AUC)提高 21.5%。InClinico 在 II 期试验结局前瞻性预测中达到 79% 准确性。

TrialGenie 利用多智能体 LLM 自动化基于结构化查询语言(SQL)的 RWD 提取,在回顾性基准研究中解析入组标准的 F1 分数达 0.911。此类模型仍面临标签泄漏( inadvertently 包含最终结局信息于训练数据中)及学习申办方特定实践而非疗效生物学决定因素等技术挑战。

四、试验中执行:从患者匹配到适应性干预

1. 患者-试验匹配


仅 <8% 的成人癌症患者参与临床试验。基于有限结构化特征的自动匹配工具错误率较高。TrialGPT 利用 LLM 处理非结构化临床笔记,实现可解释的自动匹配,达到 >90% 的试验召回率与 87.3% 的标准级匹配准确率,并将专家筛查时间缩短 42.6%。神经符号多智能体平台整合领域专用 LLM 智能体、知识图谱与人工监督,在表现上优于 GPT-4 基线,同时加快了试验推荐生成速度。

MatchMiner 作为开源临床匹配引擎,自动整合基因组与临床数据以识别合格候选者(包括人工筛查遗漏者),已在部分癌症中心完成前瞻性评估与部署。真实世界评估显示预筛查效率改善,但招募收益受患者参与意愿、入组名额可用性及下游筛败限制,效果不一。

2. 自动入组资格验证


入组资格验证是在匹配后对候选患者逐一确认其是否满足全部方案定义标准的过程,目前仍依赖人工核对非结构化临床笔记与分子报告,耗时且易出错。基于 NLP 的系统可从结构化与非结构化 EHR 数据中提取临床相关变量,实现 87.6%–90.6% 的入组决定准确性(取决于人工验证水平)。一项社区肿瘤学研究显示,系统辅助筛查 90 例患者跨 3 项试验仅需 24 分钟,而人工审查需 110 分钟。

3. 适应性剂量优化


传统 I 期剂量递增设计(如 "3+3")常无法识别最佳生物学剂量,导致患者暴露于次治疗或毒性剂量。贝叶斯模型辅助设计(如 mTPI、CRM)通过随数据积累更新剂量-毒性概率估计,已改善了规则方法。然而,这些方法依赖预定义模型与早期毒性结局。

与上述群体级统计工具不同,AI 驱动系统(通常基于强化学习,RL)作为自主学习者,基于个体患者轨迹在近实时中优化剂量决策,从寻找单一队列级"最优剂量"转向连续的个体化适应性剂量调整。CURATE.AI 利用患者级纵向数据进行个体化剂量调整;PEDOOP 整合药代动力学优化 I–II 期剂量寻找与剂量范围研究。二者均已进入前瞻性验证阶段,但尚未经过大规模、多中心随机试验证实,离常规临床采用仍有距离。

4. EHR 数据提取与结构化


入组后数据提取仍是主要操作负担:不良事件、疗效评估与剂量调整常记录于自由文本而非结构化字段。ExtractEHR 将离散 EHR 字段与一代 NLP 应用于临床笔记,以确定复杂癌症表型与并发症,表现优于人工提取,并支持多中心队列构建;目前通过快速医疗互操作性资源(FHIR)兼容应用在美国儿童肿瘤协作组中积极部署。

新一代 NLP 系统可处理时间上下文并重建纵向治疗轨迹,提取如美国东部肿瘤协作组(ECOG)体能状态评分、治疗线数、将自由文本表型描述映射至结构化入组标准等协变量。然而,基于实体瘤疗效评价标准(RECIST)的终点(需纵向靶病灶测量)通常需计算机视觉方法应用于影像数据,而非仅凭文本 NLP 即可实现。

5. 远程患者监测与电子 PRO 优化


基于可穿戴加速度计、生物传感器及智能手机数字生物标志物的远程监测框架,有望改善毒性/临床恶化的早期发现。深度学习与 ML 架构(如循环神经网络 RNN、长短期记忆网络 LSTM)可检测多模态数据流中的临床意义恶化并生成预警。回顾性研究中,基于可穿戴设备每日步数数据的 ML 模型预测放化疗期间住院的 AUC 可达 0.85;智能手机步数特征预测全身治疗期间 7 天内非计划住院的 AUC 为 0.83–0.88。需注意,若无针对性支持,数字监测可能加剧健康不平等,形成"数字鸿沟"。

6. 适应性随机化与序贯多重分配随机试验(SMART)


响应适应性随机化(RAR)与 SMART 根据累积数据动态调整治疗分配。平台试验 I-SPY 2 已基于 85% 预测成功概率(以病理完全缓解率计算)"毕业"了 >10 种早期乳腺癌新辅助治疗。AI 增强的分配方法(如基于 RL 的治疗序列)试图基于高维协变量为每位个体患者识别最优治疗方案。多目标树状 RL 可同时平衡疗效与毒性;Thompson 抽样与贝叶斯自助法可实现 ML 驱动的 I–II 期剂量寻找。DOD-BART(贝叶斯可加回归树剂量优化设计)整合患者级预后因素,实现适应性个体化剂量分配。

五、试验后推断与推广:从真实世界到数字孪生

1. 试验结果向真实世界推广


肿瘤试验人群常与日常临床实践中的患者差异显著。TrialTranslator 整合 ML 风险分层与标志性 III 期 RCT 模拟,发现高风险患者(占真实世界近三分之一)从研究性治疗中获得的绝对与相对生存获益远小于试验所见。可转移性分析(transportability analysis)利用逆概率加权估计目标人群中的治疗效果,在统计上无需 AI,但可与 AI 框架结合。

2. 数字孪生


数字孪生是模拟个体患者(或其器官)的 AI 模型,用于预测疗效、不良事件与疾病进展。肿瘤学数字孪生主要基于定量系统药理学(QSP)——一种机制性计算框架,在分子至器官水平模拟药物-肿瘤-免疫相互作用。一项 LLM 赋能的概念验证数字孪生系统应用于罕见妇科肿瘤,整合 21 例机构与发表病例数据及覆盖 404,265 例患者的 655 篇文献,生成个体化治疗计划。

然而,数字孪生面临重大局限:模型保真度(针对特定患者的校准)难以实现;广泛数据需求常无法满足;且易受校准失败影响——模拟无法反映真实世界患者肿瘤动力学,部分源于依赖启动时的静态基线数据及常规 EHR 无法捕获时间变化性未测量混杂因素。

3. 真实世界部署经验


"静默试验"(silent trials)——AI 模型在常规临床护理中平行运行但不影响临床决策的前瞻性非干预性评估——正成为正式部署前验证真实世界性能、工作流整合与社会技术稳定性的关键环节。经验表明,回顾性数据集中表现良好的模型在"实时"环境中可靠性常下降。

在一项于 Dana–Farber 癌症研究所开展的随机试验中,向肿瘤科医师发送 MatchMiner 识别的基因组试验匹配电子邮件通知(基于 AI 检测的影像学进展),尽管模型表现良好(预测治疗变更的 AUC 0.85,医师同意 83% 的通知),但干预未显著提高入组率(2.20% vs 2.03%;P = 0.41)。相反,威斯康星医学院部署的 OncoLLM-MCW 在 6 个月内筛查 514 例患者,34 项 AI 生成匹配中 9 例(26.5%)最终入组;后续扩展至 5 个团队、2,277 例患者的质量改进项目显示 100% 筛查覆盖率,协调员审查时间减少且入组数较前一年增加。

20260827-161432.jpg

原文 Figure 2:AI 在肿瘤临床试验增强中的应用按决策关键性(y 轴:模型直接影响患者健康结局的潜力与人工介入程度)、证据成熟度(x 轴:从概念/原型到早期验证、回顾性验证、前瞻性验证、已部署)及监管监督(彩色环)映射。EHR,电子健康档案;HIPAA,健康保险可携性与责任法案;GDPR,通用数据保护条例;IRB,机构审查委员会。(图片来源:原文 Fig. 2)

六、横切议题:公平性、透明度与监管

1. 公平性与算法偏见


算法偏见在肿瘤试验中的后果切实存在:中心选择算法可能加剧地理集中;入组筛查可能放大生物标志物检测不平等;自动化偏见(AI 识别的候选者接受下游临床审查,但被模型排除的患者极少再被人工复审)使嵌入的模型偏见塑造了入组队列。缓解策略应贯穿 AI 全生命周期:部署前审计数据集并记录预期使用人群;开发中采用对抗学习与群体感知优化;部署后通过反事实分析与标准化公平性指标(如等几率)监测差异结局。

2. 数据质量、漂移与鲁棒性

METRIC 框架(缺失性、错误性、时效性、代表性、不一致性、上下文)提供以 15 个"意识问题"指导训练数据适用性评估。部署后,模型易受数据分布漂移与性能漂移影响,需通过统计过程控制图进行持续监测,并在预定义漂移触发器下启动补救步骤。


3. 透明度与可解释性


透明度包含生命周期文档(可追溯性)与案例级可解释性(可解释性)。LLM 生成的叙述性理由可能增加用户信任而不反映底层准确性,造成过度依赖风险。多项指南(SPIRIT-AI、CONSORT-AI、DECIDE-AI、TRIPOD+AI、PROBAST+AI、FUTURE-AI)要求报告 AI 干预定义、输入数据、人机交互、错误案例分析、模型版本、工作流整合、性能失败分析及公平性、可追溯性、可用性、鲁棒性与可解释性的全生命周期最佳实践。


4. 监管格局


AI 在临床试验中的监管监督应被理解为风险相称的连续谱,而非"受监管-不受监管"的二元对立。FDA 与 EMA 正成为该领域监管框架的引领者。FDA 2025 年 1 月发布草案指南,提出七步"基于风险的可信度评估框架",建议申办方根据具体使用情境评估风险并记录可信度评估计划;证据期望随模型失败带来的临床与监管后果而扩展。EMA 2024 年反思文件阐明了对 AI 模型验证、可解释性与伦理适用性的期望。欧盟 AI 法案将医疗 AI 归类为"高风险",增加额外合规要求。FDA、加拿大卫生部与英国 MHRA 2021 年联合发布的良好机器学习实践(Good ML Practice)原则强调代表性数据集、人机团队性能评估、临床有意义验证、透明度与部署后性能漂移监测。日本与中国也已发布类似设备导向 AI 监管框架。

七、未来方向与结论

在所有 AI 应用中,患者-试验匹配与自动入组筛查是最为成熟的肿瘤试验增强工具。未来几年,直接支持试验执行的应用有望随着前瞻性验证积累及人机协同决策框架成熟而扩大。适应性剂量优化平台(CURATE.AI、PEDOOP)及经验证的生物标志物预测模型在嵌入临床医师监督决策工作流后,近期临床整合可行。预后性应用(如数字孪生)仍属长期目标,需在模型验证、数据基础设施与监管监督方面取得实质性进展。

跨阶段进展取决于若干使能优先事项:在多样化患者人群中前瞻性评估 AI 工具、改善数据互操作性与标准化、以及具备评估适应性 AI 系统能力的监管框架。联邦学习基础设施(如 APOLLO11 与 ODELIA 项目)可能通过在不共享原始数据的前提下实现跨机构协作模型开发,帮助解决数据碎片化问题。

总体而言,AI 方法为试验设计、操作效率与复杂临床数据解读提供了新工具。下一阶段应优先在临床试验场景中对 AI 工具进行严格前瞻性验证,并透明评估其在不同患者人群中的性能。至关重要的是,监管框架必须随协调证据标准的定义而同步演进;数据质量标准与报告指南亦须随之发展,以确保 AI 赋能方法可被一致评估并负责任地整合入临床试验。在此基础上,AI 有望重新定义肿瘤试验方法学,推动更具适应性、以患者为中心的循证医学证据生成模式,最终加速有效疗法的可及性、减少无效治疗暴露并改善患者结局。