AI 见闻
精选· 重要性 4/5

因果模型需要因果数据:Xaira的X-Cell模型与AI驱动药物发现

Latent Space (Swyx)··RJ Honicky·约 4 分钟阅读
中文导读

Xaira Therapeutics通过构建因果数据集X-Atlas和扩散模型X-Cell,突破了传统基因表达模型的信息瓶颈,实现了对基因扰动效果的准确预测,为AI药物发现开辟新路径。

押注信息如果测试损失在1.5B参数后趋于平稳,而训练损失随着规模扩大持续下降,这表明你的模型受到数据中信息量的限制。在单个较小数据集上训练暴露了信息缺口:3.1B模型偏离了扩展趋势。无论是参数还是算力都无法突破这堵墙来提升性能。

要预测基因表达的变化,你需要信息更丰富的数据。这正是Chu和Bo团队所做的,以下是约30倍信息量带来的效果:现在我们可以随参数和训练算力一起扩展!我们不知道这项工作花费了多少,但可以猜测数据收集实验和基础设施投入了数千万美元,算力加人力和研究投入了数百万美元。

预算看起来像RL rollout的预算,而非数据丰富的预训练预算。我们很幸运邀请到这个故事中的两位核心人物参与播客。以Ci Chu和Bo Wang为首,Xaira Therapeutics押注信息丰富的数据是AI驱动药物开发的关键。

Chu最近晋升为首席发现官,Bo晋升为首席AI科学家,这凸显了Xaira对这一赌注的战略重视。

在不同类型的细胞、不同环境下,哪些RNA在漂浮。这就是CELLxGENE,一个由Chan Zuckerberg研究所构建的包含1.68亿个细胞的数据库,它将每个细胞映射到该细胞中检测到的20K-30K个基因的计数,以及每个细胞的详细元数据。

一个约4万亿条目的矩阵。如果说蛋白质数据库(PDB)解锁了结构生物学模型,那么CellXGene为虚拟细胞模型做了同样的事情。与PDB一样,CELLxGENE激发了一系列RNA表达AI模型;以至于RNA表达模型已成为虚拟细胞模型的代名词。

Bo Wang构建了其中最具影响力的scGPT,成为Xaira新模型的起点。RNA表达 ≠ 虚拟细胞在CELLxGENE上训练的模型描述了细胞类型和细胞状态之间的关系,但它们不擅长预测如果我们改变RNA表达会发生什么。

基因表达的变化高度相关,在大多数情况下很难(不可能)弄清因果关系。然而,如果你能一次“调低”一个基因,那么你就能观察到给定基因的上游和下游。

你可以判断是A→B和C,还是B→A和C,或是B→A、C→B→……如果你对所有基因都这样做,那么也许你可以训练一个模型,预测当你改变一个基因(例如通过药物或基因编辑)时细胞会发生什么。

或者,你也许能找出改变特定基因表达的最小侵入性方法。X-Atlas → X-Cell这正是Chu和Bo团队所做的。数据集称为X-Atlas,模型称为X-Cell。

在这一集中,我们讨论了:为什么团队放弃自回归转向扩散基于CRISPR的实验并行运行数百万次测试,为X-Atlas和X-Cell生成原始数据泛化到真实人体细胞中的真实实验室实验击败了此前优于其他模型的线性基线证明大量先验知识的合理性,

以及它们与数据和架构的对比Bo还与我们分享了他作为学术界与行业领导者相比的一些(主要)优势,以及他的实验室如何跟上AI创新的飞速步伐。在YouTube或你最喜欢的播客平台上查看完整剧集!

这些晋升发生在我们录制这一集之后当然,连锁反应中可能存在循环,也可能存在二阶、三阶等效应(即只有当多个基因同时改变时才发生的事情),但一阶效应是一个很好的起点,可能告诉我们很多需要知道的信息。

原文出处
Causal Models Need Causal Data - Xaira’s X-Cell model for Drug Discovery (Bo Wang & Ci Chu, Chief Discovery Officer & Chief AI Scientist)

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读