虚拟细胞正迎来AlphaFold时刻!多尺度预测复杂细胞生物学,指导疾病治疗,颠覆药物研发

虚拟细胞模型的定义与价值 - 虚拟细胞模型是能够预测细胞在不同尺度和生物学情境下行为的新前沿工具,正迅速革新药物发现领域[2] - 虚拟细胞模型通常被定义为能够预测扰动如何在不同细胞环境中改变基因表达的转录组模型[6] - 该模型可从患者基因组出发,预测免疫细胞在疾病与健康状态下的行为差异,为靶点发现、机制研究、患者分层、毒性预测及药物开发提供宝贵工具[3] 模型开发的关键挑战与行业努力 - 构建虚拟细胞模型的关键在于大规模、高质量、公开可获取的多模态数据集,数据需涵盖不同模型系统、生物体、干预方法和细胞状态[4] - Chan Zuckerberg Biohub于2024年4月宣布向虚拟生物学计划投入5亿美元,这是一项为期五年、旨在加速开发虚拟细胞模型所需技术和数据集的计划[4] - 行业类比认为,细胞生物学正面临类似蛋白质结构预测(AlphaFold)爆发前的转折点,目前缺乏类似蛋白质数据库的等效资源,虚拟生物学计划旨在改变这一现状[4] 主要参与者与模型技术路径 - Arc研究所的STATE模型:能够预测干细胞、癌细胞和免疫细胞对药物、细胞因子或基因扰动的反应[6] - Xaira Therapeutics的X-Cell模型:虚拟细胞领域首个规模法则验证模型,参数量高达49亿,由诺奖得主David Baker教授创立,种子轮融资10亿美元[6] - Xaira的训练数据:构建了名为X-Atlas/Pisces的大规模数据集,包含来自7项筛选实验和16种生物学背景下的2560万个细胞[6] - Ginkgo Bioworks的Ginkgo Datapoints平台:研究方向侧重于群体平均基因表达水平的Bulk转录组,而非单细胞方法[7] - Ginkgo Datapoints的数据发布:其虚拟细胞药理学计划首批数据对约2280种小分子进行了完整的剂量反应谱分析[7] - GenBio AI的跨尺度世界模型:致力于开发跨越从分子到调控网络多尺度生物学的“AI驱动的数字生命体”,不依赖内部数据生成,聚焦公共数据与合作伙伴关系[9] - GenBio AI的ProtiCelli模型:一个深度生成模型,基于人类蛋白质图谱中的123万张图像训练,能够模拟12800种人类蛋白质的空间分布,并可推广至新细胞类型和药物干扰[11] - Cellular Intelligence的虚拟细胞信号转导模型:旨在模拟细胞状态随时间变化,通过学习细胞分化信号序列的“语法”,实现按需生成任意类型细胞,以拓展再生医学应用[12] 技术路径的多样性与反思 - 行业认识到方法多样性的价值,如同模型受益于训练数据多样性[7] - 有观点指出细胞不仅是RNA,而是由蛋白质丰度、染色质状态、空间组织、代谢等多层次因素决定的复杂系统,并非单一模态永远足够,但当训练语料库足够大时,单一高质量、可扩展的模态能支持通用表示[8] - 存在对“路灯效应”的担忧,即行业可能正在扩大能够做到的事情,而非应该做的事情[8] - 整合生物学先验知识(如蛋白-蛋白相互作用)的模型可显著提升预测性能,空间和时间数据能捕捉仅靠序列数据无法解析的关键功能维度[11] - 根据人类蛋白质图谱,约60%的人类基因编码的蛋白质会定位在多个细胞区室,并根据环境执行不同功能[11] 应用突破与商业进展 - Cellular Intelligence的技术突破:其平台采用半透性胶囊技术,结合活细胞培养与全基因组读数,并行测试数百万种信号组合,研究人类干细胞分化的效率比传统方法高出1000倍[13] - Cellular Intelligence的商业合作:2024年5月,公司与诺和诺德合作,收购了其已获快速通道资格的帕金森病异体细胞治疗项目STEM-PD,成为具备2期临床试验准备条件的AI驱动公司[13] - 合作背后的逻辑:诺和诺德选择合作是因细胞治疗的下一个重大挑战在于生产规模扩大、可比性、临床物流及商业化准备,而不仅是生物学问题[14] - 公司的虚拟细胞信号转导模型将用于解决阻碍细胞疗法实现临床突破的关键环节之一——protocol开发[13] 行业现状与未来方向 - 已知的人类细胞类型中,不到百分之一能可靠用于细胞治疗的下游应用,研究人员在设计特定细胞类型时面临巨大搜索空间,因为仅20条基本分子信号通路就可产生成千上万种细胞状态[12] - 虚拟细胞模型的多样性正在拓展复杂生物学的新维度,每一种方法都朝着临床应用迈近一步[15]

虚拟细胞正迎来AlphaFold时刻!多尺度预测复杂细胞生物学,指导疾病治疗,颠覆药物研发 - Reportify