万维读者网 > 信息时代 > 正文  

提出AI虚拟细胞的团队,现在要虚拟整块组织了

www.creaders.net | 2026-08-20 14:37:08  MIT科技评论 | 0条评论 | 查看/发表评论

  2024年12月,洛桑联邦理工学院(EPFL)的夏洛特·邦纳(Charlotte Bunne)团队联合瑞士斯坦福大学、谷歌研究院、哈佛大学等机构在《细胞》(Cell)发文,首次系统阐述了“AI虚拟细胞”(AIVC)这一全新研究范式:用基础模型学习跨维度、跨模态的生物数据,构建一个能预测健康和疾病状态下细胞行为的通用表征。

  去年多过去,AIVC方向修复出数据种针对单细胞组学和基因组序列的基础模型,覆盖细胞类型识别、干扰响应预测、基因功能等推断任务。但进入更大的尺度,虚拟组织(Virtual Tissues)层面的工作仍然稀少。

  原因在于,空间蛋白质组学本应是组织模型最理想的数据形态之一,而由于抗体面板、推理平台和实验协议高度异质,领域长期一方各自为战的孤岛状态,通用表征迟缓没有出现。

  为了解决这个问题,近日,邦纳正式推出VirTues基础模型,这是一种团队计算化、空间分辨的组织状态表征。在虚拟空间里,该模型首次实现了对真实组织信息的跨队列累积、比较、查询和不同任务间的复用。研究已于8月5日相关发表于《自然》(Nature)。

  孤岛困局与三层解法

  由此推断质谱流式(IMC)为代表的空间蛋白质组学技术,由伯恩德·博登米勒(Bernd Bodenmiller)团队于2014年今年提出,核心思路是用金属同位素标记抗体,对抗激光烧蚀和飞行时间质谱,在组织切片上同时测量浓缩种蛋白,同时保留亚细胞级空间分辨率。此后,共检测(CODEX)、Orion、锁定离子束成像(MIBI)等平台的问世,推动肿瘤微环境研究进入更加精准可控的新阶段。

  然而,这种高度灵活的技术,也让组学数据队列更加分散:角落可以自由选择前缀面板和不同的标志物组合,不同平台的动态范围和噪声都存在差异。这就导致为单一队列开发的分析工具,换到另一个数据集上往往会失灵,难以稳定的知识迁移和可复用的生物标志物。

  这些限制,VirTues给出了面对的解法有三。其一是标记物的语义化编码。传统的视觉基础模型要求固定的输入通道数,且无法处理训练时从未见过的标记物。但团队不再把每个通道视为抽象的第N维数据,直接通过蛋白质语言模型ESM-2为每个抗体的表情对应生成一个序列层面的“身份标识”,即使两个队列使用不同面板,模型也能在生物学上以同一空间理解它们。

  标准视觉变压器架构的自注意力计算量会随空间尺寸和通道数量呈平方增长,对此,VirTues选择把注意力拆成禁忌:标记物注意力只让同一空间位置的不同通道双向交互,捕捉之间的相关性;空间焦点只让同一通道内不同位置的令牌双向交互,捕捉排布。这种视频类似空间变压器中“时空分离”的思路,极大压缩了复杂计算度。

  VirTues 还设计了多几何图形表征:模型输出常规图像Token,并把每个通道图像的切分参与计算的小块(patch,大致细胞的范围),在每个空间位置额外设置一个可学习的“汇总单元”,用于吸收该位置所有通道的信息。训练完成后,这些汇总单元可以按细胞分割码聚合成细胞级表征,也可以按更大范围聚合一个成微环境和整体应答级的表征。同一个组织干细胞因此可以同时服务于从亚细胞到样本的多个任务。

 (来源:《自然》)

  从全栈能力到临床落地

  VirTues 的训练语料是目前公开的最大规模空间蛋白质组学集合。数据核心由 15 个 IMC 队列组成,覆盖 8 个器官部位、3,102 名患者、146 种独立标记物;为验证跨技术泛化能力,又划分 32 个队列、4 名患者和 239 种标记物。模型采用掩码自编码器(Masked) Autoencoder)框架进行自监督预训练,通过独立掩码、整通道掩码、区域掩码清除由易到难的策略学习重建被隐藏的信号。

  具体性能上,VirTues在阿联酋需要多个专用工具组合的下游任务中表现良好。例如,9个数据集中,VirTues的细胞分割能力在8个超过广泛使用的Cellpose、InstanSeg、StarDist等工具上;细胞分型上,其平均表现在多数KRONOS、通道无关掩码自编码器(CA-MAE)等同类基础模型上。

  VirTues 的零样本泛化能力也值得一提,如果把某个队列排除在训练之外,模型在未见样本上的表现几乎没有下降。而在跨技术泛化层面,若将仅用 IMC 数据训练的 VirTues 迁移至从未见过的 CODEX 和 Orion 数据,其识别水平也超过同类模型。

  真正让这项工作与“应用”接轨的,是在三个阴性乳腺癌中的验证之一。作为全局最差、有效的诊断手段最少的癌症亚型,近年来,领域尝试使用免疫检查点双胞胎(ICI)控制其进展,但反应率始终有限。

  例如,KEYNOTE-522试验的结论支持在新辅助治疗中加入PD-1己帕博利珠单抗(pembrolizumab),而使用PD-L1父阿替利珠单抗(atezolizumab)的NeoTRIP米开朗基罗试验则未能观察到病理完全率的显着进展。

  如何在开展治疗前准确预测患者的批次情况,成为临床上需要解决的问题。

  为此,团队以 NeoTRIP 队列的 138 名患者发现集,让 VirTues 在无人预设中假设下从治疗前适配器中自动挖掘预测特征的前提,最终提炼出两个反应签名和两个非反应签名。 签名反应组合预测化学-免疫治疗的表现,明显遵循原论文的空间预测指标,也超过了一系列临床常规轴线。

  更关键的是,VirTues挖掘出的签名具有可解释性和跨队列迁移能力。邻居签名被迁移到另一项独立、未参与模型训练或签名发现的三阴性乳腺癌队列中,同样能对无病生存期做出稳定的分层、一致性指数超过原论文的分层系统。

  这表明,也许一个专门做反应预测的模型,已经掌握了具备一定普适性的疾病生物学。

  推动生物标志物发现走上高速公路

  VirTues 的意义不仅在于一套好用的空间组蛋白学整合工具。它使最初的 AIVC 愿景进入组织尺度:一个模型骨干覆盖从细胞分割到临床生物标志物发现的完整链条,同时容纳面板和多种技术平台,并在星巴克成像数据上验证了孔径。

  后续扩展方向已经明显清晰:结合病理切片,把分子特征的深度和病理形态的广度整合进同一模型;接着插入数据和生成式建模,让虚拟组织从快照走向动态模拟。

  团队论文中坦承了当前的开幕:模型的零样本重建表现,在与训练集蛋白关系较远的新标记物上明显下降;稀有状态和罕见组织结构的覆盖因此仍然不充分;生存分析部分尚属回顾性验证等。,该模型参与临床决策前,需要与经过校正的独立队列建模和实验一致。

  未来,VirTues存在更大的潜力,将改写生物标志物的发现方式:从依赖人类假设、以单个蛋白或细胞比例为核心的传统路径,由模型走向大规模数据中自动识别复合空间程序、再系统化其生物学认知的快速通道。

   0


热门专题
1
朱镕基
6
世界杯
11
以伊战争
2
中美冷战
7
张又侠
12
委内瑞拉
3
美伊战争
8
中共两会
13
四中全会
4
川普
9
俄乌战争
14
何卫东
5
万维专栏
10
中日关系
15
AI
关于本站 | 广告服务 | 联系我们 | 招聘信息 | 网站导航 | 隐私保护
Copyright (C) 1998-2026. Creaders.NET. All Rights Reserved.