关注AI在生物医学领域发展的小伙伴们,可能最近有注意到,一项重量级的研究成果在《Cell》杂志见诸报端,宾夕法尼亚大学的研究团队,首次将大语言模型(LLM)系统性地应用于CAR-T细胞的治疗靶点发现,他们利用了单细胞转录组学、公共知识库和LLM推理的AI框架,成功鉴定出GPNMB作为CAR-T治疗的通用靶点,并在白血病、黑色素瘤和结直肠癌等多种临床前模型中验证了其卓越的抗肿瘤活性。

那么接下来就由小编带大家来解析,纵观本篇文章的研究范式,以及简单评点对我们一线生物医学工作者有何研究上的启发吧。
一、研究的起点
我们知道,嵌合抗原受体T细胞(CAR-T)疗法已在血液系统等恶性肿瘤中展现出治愈潜力。然而,该领域的核心瓶颈在于安全靶抗原的匮乏。传统的靶点发现流程依赖人工筛选数据库、手动评估组织特异性、判断细胞表面定位等,过程耗时费力且成功率有限。于是作者思考到了,如果将LLM的推理能力与高分辨率单细胞图谱相结合,能否构建一个可扩展的、系统性的CAR-T靶点发现框架?
于是作者首先从癌症领域的现有数据入手,整合了四个公开发布的皮肤癌单细胞RNA测序数据集(涵盖基底细胞癌、鳞状细胞癌及不同分期的黑色素瘤,包括转移灶)经Harmony算法校正批次效应后,与Tabula Sapiens健康人皮肤数据集整合,构建了包含124,620个细胞(其中106,834个为恶性细胞)的单细胞参考图谱。这一图谱是该研究的核心数据基础设施。
对于每个候选基因,作者从亚细胞定位、肿瘤特异性、组织安全性、临床可转化性等多个维度进行综合打分,并设定不同的比较权重。向三个独立LLM(OpenAI GPT-4o、Anthropic Claude-3.7、Google Gemini-2.5-Pro)输入包含六个预设权重方案的候选列表,要求其在1,000次独立模拟中优化各特征的相对权重。
随后作者对所有基因计算综合评分,筛选出top 100进行深度评估。三个LLM各进行1,000次独立提名,每个模型从100个基因中选出10个最有潜力的CAR-T靶点,并从标注好其依据的打分理由。从中筛选发现GPNMB是三个模型的综合累积提名频率最高的基因。其入选理由兼具肿瘤特异性(主要)和多癌种潜力(次要),呈现出独特的多维度优势。

最后,作者并没有仅停留在纯数据层面上,而是进一步落实到了小鼠癌症模型当中,分别在白血病U937、黑色素瘤SK-MEL-3、结直肠癌SNU-503的异种移植模型中,以检测上述AI筛选得到的结果。作者基于glembatumumab vedotin抗体(已在临床试验中验证靶向GPNMB的可行性)的单链可变区(scFv),构建了CAR T细胞,流式细胞术、免疫荧光、免疫组化(组织芯片)等手段,发现以GPNMB为靶点的CAR T细胞治疗方案,对上述三个不同癌种,皆体现了高效的肿瘤治疗效果。
本篇文章是首次直接将AI大模型运用在癌症的直接靶向CAR T治疗上的研究工作,提出了新的靶点追踪方法,并实际验证了其临床前潜力,具有重大的价值和意义。
文章中采用了多个皮肤癌单细胞RNA测序数据集的校准整合,以获得最坚实的模型构建起点。并且作者还额外验证了,若用bulk RNA-seq替代scRNA-seq,最终提名结果几乎完全不同,且会引入TIGIT、CTLA4等实际上由肿瘤浸润淋巴细胞表达的伪阳性靶点。这提示我们,优秀高质量的测序数据集,一定是做“高大上”AI医学研究的基础。
②多LLM模型交叉验证,抵消单个独立AI带来的不确定性:
作者没有依赖单一LLM,而是同时使用OpenAI、Anthropic、Google三个模型,各进行1,000次模拟,并比较其输出分布,以揭示模型特异性偏好,理解系统偏差来源,使得研究者可以量化结果的置信度。
③干实验——湿实验的研究闭环:
其实本公众号也陆陆续续发过许多AI+生物医学大模型的文章,小伙伴们如果都注意看了,也能发现,本篇在AI模型的搭建上,并不是最特别、算法最先进巧妙的那一类。之所以能刊发在Cell顶刊上,除了作为第一个利用AI做CAR T治疗癌症的里程碑之外,最关键其实还是对于基础医学实验和临床意义的回归。
另外,为更全面地展示和分享AI在生物医学领域的应用,小编基于药物/疾病靶点筛选这个主题,额外寻找了两篇从思路和方法上都各有特色的文章,在这里一并给大家简略地解读一下:
这是一篇发表在《Advanced Science》上关于子宫内膜异位症领域的研究,利用专用AI靶点发现平台(PandaOmics)+批量转录组数据,找到靶向药物治疗的新靶点。

子宫内膜异位症是一种慢性炎症性妇科疾病,影响全球5%-15%的育龄女性。其核心病理是子宫内膜样组织出现在子宫腔以外的部位(卵巢、腹膜等),引发慢性盆腔痛和不孕。该领域的靶向药物开发严重滞后,缺乏对非激素通路的干预手段。
研究团队从GEO和ArrayExpress数据库中检索了36个子宫内膜异位症相关的批量转录组数据集(含microarray和RNA-seq),把基于11个病例-对照比较组(涵盖不同疾病亚型和月经周期阶段)进行了荟萃分析。
作者使用了Insilico Medicine的云端靶点发现平台PandaOmics作为研究工具,该算法核心是一种多模型集成(Ensemble Approach)架构,筛选发现了GBP2(鸟苷酸结合蛋白2)和HCK(造血细胞激酶)作为结果中排序最高的两个候选蛋白,重要的是,它们在子宫内膜异位症文献中几乎为空白,说明未被探索但生物学信号极强。额外地,还发现了其他适应症中研究充分且已有获批药物的靶点ITGB2,显示出“老药新用”的研究潜力。
最后,作者同样进行了基础生物学实验,通过免疫组化(IHC)在自搭建的临床队列(正常、卵巢EMS、腹膜EMS各10例左右)中检测GBP2/HCK/ITGB2在蛋白水平的表达,并在体外水平子宫内膜异位症基质细胞(hEMSCs)中进行siRNA瞬时敲低,验证了上述靶点对于细胞增殖(CCK8/Ki67)和凋亡(TUNEL)的影响。


炎症性肠病(IBD,包括克罗恩病和溃疡性结肠炎)全球发病率持续上升。30-50%的克罗恩病患者会并发肠道纤维化,导致肠腔狭窄、梗阻,最终不得不进行手术切除。然而,目前尚无获批的抗纤维化药物用于治疗IBD相关肠狭窄。近年来,单细胞测序揭示了肠道中存在一类炎症相关成纤维细胞(Inflammatory-Associated Fibroblasts, IAFs),它们是连接炎症与纤维化的免疫枢纽,但针对IAFs的药物靶点几乎空白。
作者首先进行了的单细胞转录组验证,选取人结肠成纤维细胞系(CCD-18co)用TNFα、IL-1β、TGFβ、OSM、IL-36等6种IBD相关细胞因子刺激细胞,进行单细胞RNA测序(scRNA-seq),并将体外刺激产生的细胞簇,映射至公开发表的溃疡性结肠炎(UC)患者结肠活检的单细胞图谱。发现其中TNFα和IL-1β处理诱导的细胞簇(Cluster 2/6),其基因特征高度重叠于患者体内的IAFs(炎症相关成纤维细胞),因此选用作为临床意义明确的IAF表型。
接下来作者设定了两种完全正交的读数(Readouts),包括通过HTRF(均相时间分辨荧光)手段读取的炎症/纤维化生物标志物——CXCL10(IP-10),以及使用使用6种荧光染料(Hoechst染核、ConA染内质网、SYTO14染RNA、WGA染高尔基体/膜、Phalloidin染F-actin、MitoTracker染线粒体)对同一个孔里的活细胞进行染色成像Cell Painting(细胞绘画),提取的共860个形态学特征。通过AI/机器学习的数据分析,进行线性预测模型(Linear Predictive Model)打分。结果发现mTOR、PI3K等直接干预细胞的炎症信号转导和生存应激,而VEGFR、PDGFR、FGFR、c-Met、c-Kit、MEK等抑制了TNFα诱导的细胞形态学改变,体现了组织重塑、血管生成和纤维化进程的核心特征。

最后作者通过多重验证(Bucket分析)锁定到三条主要生物学通路:内质网应激(ER Stress)通路、纤维化/血管生成通路、炎症通路,并由此识别出两个已获批的IPF药物Nintedanib(尼达尼布),和Pirfenidone(吡非尼酮),充分证明了该筛选平台命中结果的临床相关性和高度转化价值。
看完了这三篇文章,我们把这各自疾病领域、关注目标、数据搭建手段都截然不同的AI用于药物/疾病靶点筛选的工作进行一个简单对比性总结,可以看到:
特征
这些文章虽然发表时间、具体分数都不尽相同(不过都是一区高分~10+以上文章),但其中我们需要抓住的共性在于:
|
特征 |
文章:1:LLM驱动的CAR-T靶点 |
文章2:AI平台驱动的子宫内膜异位症靶点 |
文章3:AI图像表型驱动的抗纤维化靶点 |
|
疾病领域 |
多癌种(黑色素瘤、白血病、结直肠癌) |
子宫内膜异位症(慢性炎症/妇科) |
肠道纤维化(IBD并发症) |
|
核心AI技术 |
LLM(大语言模型)推理 |
专用集成模型(PandaOmics) |
传统机器学习(监督式PCA/线性模型) |
|
数据模态 |
非结构化文本 +单细胞转录组 |
结构化批量转录组(Bulk RNA-seq) |
高维静态图像(Cell Painting) |
①原始数据集的质量和解读水平是重中之重;
②生物学/医学意义大于信息学模型的搭建和处理;
③计算-实验的闭环验证对于发AI的高分文章,非常重要。
好了,本次的AI+生物医学的文章解读就到这里,大家如果有任何想法欢迎私信小编!

组织芯片网


