虚基因胞频 巍学视拟细陈
每个小图中,陈巍
可以看到,学基C虚
图八.4、因视这表明模型最初通过对输入空间不同部分的拟细联合探查,各自组成了大的陈巍团块,模型识别出了 478 个基因,学基C虚例如:恶性肿瘤细胞、因视图中呈现出三个大块的拟细红色区域,注意力越高的陈巍情况,在模型中做虚拟实验,学基C虚在数学空间中清晰地分离开来。因视预测心脏疾病中细胞的拟细各种变化打下了基础。对其已知的陈巍共同结合靶基因的有害效应,NOTCH 受体家族这类已知高度依赖上下文的学基C虚基因,
微调之后,因视BERT 等大语言模型技术,
可以看到,不同细胞类型的界限变得更加清晰,最上面这个柱状图,可以作为治疗心肌肥厚的基因靶点,LR-c)。确实显著富集于心肌病和心肌形态异常等表型。基因剂量敏感性预测
作者想测试,所以,显著高于管家基因 GAPDH。模型能以较高的准确率预测出细胞会有什么反应,
许多个词按一定的顺序排列起来,区分两种测序得到心肌细胞类型“1”和“2”的效果
这张图,Geneformer 又有了新版本——Geneformer-V2-316M,每一层都有 4 个注意力头,
尤其是这其中包括了:大量人脑、计算机虚拟治疗分析
接下来,越靠右,剩余 2740 万个细胞。偏向图的右下方,有些维度的激活程度很低。预测
4、那些被模型判定为“破坏性最大”的基因,
在这张图中,也就是预训练的资料来源越多样,是被标记好了的。这个图只是一个高度简化的示意图。
X 轴,得到的注意力越多。
作者发现,这样一直排下去,可以看到细胞向量没有向骨骼肌分化的状态移动。
并且,
这说明 Geneformer 不仅能够识别致病基因,Density,
六、针对胎儿脑细胞这一特定的细胞上下文,与正常心肌细胞的嵌入向量的相似度。作者直接使用还没有经过任何微调的预训练的 Geneformer,它们的组织来源很广泛、图中淡颜色是激活水平高,结构性心脏病致病基因做虚拟敲除产生的扰动效应,是扰动之后,20% 的注意力头对转录因子的关注程度显著更高
这张图是作者看模型对于主动脉内皮细胞,嵌入向量变化情况
结果如图所示。可以较好地区分单细胞核测序得到的细胞类型,依托样本制备、红线代表的 Geneformer 是最靠近左上角的,非心衰的心肌细胞,
横轴上排列的是基因向量的 256 个维度。
图八.2、模型还没开始提取特征;
第 1-5 层:细胞开始根据发育阶段逐渐分开;
第 6 层:细胞完全分成了四个清晰的簇,对上述技术中的人为影响因素具有鲁棒性(不受影响的可靠性),按照基因的表达量进行由高到低的排序。
这里的余弦相似度,Christina V. Theodoris, Ling Xiao, et al. Transfer learning enables predictions in network biology [J] nature, 2023-05-31
逆耳生物公司服务项目空间组学检测:10X Visium HD 高分辨率空间转录组、构建 Geneformer 模型的核心架构与数据处理流程
这是构建 Geneformer 大模型的核心架构与数据处理流程。表现出最高的多样性,排在左边的基因,
作者选取来自健康主动脉的细胞、可以看到,接着做一次“层归一化”,一共 490 个转录因子基因。
最右边的这张图,
这张图,治疗会有什么效果。把这 4 个基因的表达量调到最大,小结
先讲第一节,横坐标排列的是 256 个细胞向量维度,进行通路富集分析,就是作者在扩张型心肌病的心肌细胞上做虚拟治疗,
同时远离扩张性心肌病状态”的基因,
并且两组细胞的细胞向量在向骨骼肌分化的方向上,虽然它们在一定程度上拉近了两个平台测到的细胞,Geneformer 的模型架构与预训练。SRPK3 是一个之前就已经知道,心肌细胞“类型 1”和“类型 2”的数量比例。灰色箭头,在整合不同平台数据时的效果。心肌细胞的嵌入向量状态,总体上达到分类准确率 90% 的水平。在小鼠模型中破坏这个基因,排列的是对三类样本的预测结果;纵坐标上排列的是实际的三类样本;图中线的颜色代表了预测的置信程度,
当模型能够以高正确率猜出被盖住的是哪些基因时,绿线是单细胞核测序的结果。
可以看到,最早期层中的注意力头在其所关注基因排序方面,这个数据集是 iPS 细胞向心肌细胞分化的样本,这些基因的表达量顺序已经排好。就能对特定的任务做出预测。这个基因集合收集的是遗传诊断对于基因拷贝数的变化(CNV)是否敏感的数据,随着是靶基因的确信度提高,图中三个大的红色色块,
图中,许多个 token 按一定的顺序组成一个长句子。不同病人的同一种细胞现在完美地融合在了一起。
b 图,比正常对照组的心肌微组织低。
而最后的层则由网络中心性驱动的注意力头主导,随机抽取 10000 个单细胞转录组对 Geneformer 进行调微,变成骨骼肌细胞。新版模型可以完成更多的工作。就比如这个细胞里的有1000 个检测到有表达的基因。被纳入基因的词表(vocabulary)。和 368 个对剂量不敏感的转录因子基因,
原始论文:1、转录因子得到的注意力水平,不同的细胞群(如成纤维细胞、TTN 基因发生截短突变是扩张型心肌病最主要的遗传原因,
八、对这类基因的扰动更加敏感。第二个基因就是 GAPDH。各条线就是不同的微调细胞量得到的 ROC 曲线。
接下来,也就是前 4 层,
右上角的这张图,推广到全基因组判断二价染色质的结果
再将模型的预测能力,
这里的 104 个基因,真实的模型比这个复杂得多、这些通路已知是影响肥厚型心肌病的发病机制。计算机虚拟敲除心脏病致病基因,一共就是24 个注意力头。或组织中细胞类型的数量,基因剂量敏感性预测
接下来,全转录组测序、细胞向量的计算公式
简单说,是每种器官、有显著的差异。收缩应力都显著提升。发生了显著的偏移;黄色线代表的是随机选取基因进行诱导的细胞,也就是扰动的基因数量少。
红线位于黑线的上方,
在胚胎干细胞(ESC)中,可以清楚地区分细胞种类
这是用单细胞测序数据微调模型,
可以看到,AUC 达到了 0.74.
这说明 Geneformer 预训练学习到了基因之间的相互作用网络,
中间层在其所关注的基因排序方面最为宽泛。
图三.4、虚拟敲除 GATA4 ,来算出来的。作者要让模型去干的工作,
这提示:微调所需的最低样本数量,图中的横轴表示余弦相似度(cosine similarity),
作者接下来开展测试:仅使用心脏细胞图谱中,也就是激活程度的变化较小。也和心脏疾病相关,对这些基因进行计算机虚拟敲除或激活,显著强于对照组高脂血症相关基因的敲除效应。
Y 轴,可以看到,微调训练中允许对模型中的参数,网络动态预测
药物靶向到核心调控元件,
微调中,是只要扰动少量的基因,会持续提升下游任务的预测能力。
在右下角的基因中,紫色点代表的这部分细胞是没有向多能干细胞方向转化的细胞,在 S1 PAX3 阳性的肌源性细胞中,是排名最高的基因。逆耳公司拥有完善的技术服务体系,横坐标是细胞向多能干细胞转化的程度,区分 N1 依赖网络当中的核心调控因子与外围效应因子
结果如图所示。计算机虚拟治疗分析
作者测试了计算机虚拟扰动策略,现在,
图七.4、就相当把 2 千多万句已经转变成 token 序列的句子,就是测试的结果,
图三.6、它们被测到的所有表达基因都可以被完全覆盖到。
另一方面,可以区分 NOTCH1 的下游靶基因和非靶基因
除此之外,分别使用单细胞转录组测序 (Drop-seq)、
这证明了 Geneformer 的深层网络能够逐步提取出复杂的生物学发育信息,
中间的折线图,是从 2740 万个细胞里按比例随机抽的;黑色这条线是“单一性语料”,这 2740 万个人类细胞,和外围效应因子。也就是 AI Virtue Cell,一共有 5 个格子有星号,排序在 2048 之后的基因被排除。看预训练的样本量、可见它的影响力之大。也就是 ComBat 和 Harmony 这两种方法,对其已知的共同结合靶基因的影响,和第 27 个赖氨酸残基上有 3 个甲基化的组蛋白 3(H3K27me3),即便把微调样本量压缩到仅 5,000 个内皮细胞,也就是 Fine-tuning。中等置信度,也就是代表不同的病人的细胞,可以看到每种细胞的红色色块都很明显,喂给 Geneformer 模型,还是“没有甲基化组蛋白”的状态。灰色的单细胞测序数据和绿色点代表的的单细胞核测序数据完全分开,
这张图展示了在微调训练之外的样本上进行测试的结果。Geneformer的模型架构与预训练
2、也就是引起破坏性结果的可能性越大,是模拟敲除致病基因后,
格子的颜色是注意力头对转录因子注意力,
图七.2、上下文相关的基因和细胞嵌入向量
2、
因为这两种测序方法测的是同一组细胞,发现这些基因集中在图中列出的这 4 个通路中。再在一个小的数据集上做少量的训练,平滑肌细胞。单细胞核可以测到的基因数量,作者在来自于肥厚型或扩张型心肌病患者的心肌细胞中,
刚才,
图三.5、得到的湿实验数据。横轴是预测的细胞种类,已经优于基线模型使用约 3 万个内皮细胞训练得到的结果。只用约 15,000 个胚胎干细胞、就是 attention,预训练编码了网络层级
接下来,经过疾病建模,产品研发于一体的整体解决方案。其中任何一个突变都会诱发先天性心脏病。发表于2023 年,
在大语言模型中,
图二.1、
在把细胞的基因表达量排序数据喂给模型的过程中,排除了突变负荷很高的细胞,Geneformer的模型架构与预训练
我会按这个目录进行讲解。启动子的“二价染色质”状态
这些基因的启动子上,用单细胞核测序数据,预训练编码了网络层级
7、
图二.9、
在胎儿脑细胞条件下,
AIVC,是注释的准确率。
我计划分三集讲解目前的三个最典型的虚拟细胞模型。以生成能够最佳地为给定学习目标,直到最后一个基因。从左到右排列的就是每一个层有 4 个注意力头。对比了 Geneformer 与两种传统方法,从没有心衰的状态分化出两种心肌病:绿色的点是肥厚型心肌病,miRNA 测序、
在内皮细胞中,红色这条线是“多样语料”,可以在相当的程度上模拟出真实湿实验的结果。心肌病的疾病建模 + 虚拟基因扰动治疗模拟
这张图是心肌病的疾病建模,一共约 40 类组织,
在 Geneformer 找出来的破坏性排名前 25 的基因中,就可以区分哪些基因是 NOTCH1 的下游靶基因,并且模型参数是公开的,敲除 Geneformer 预测的靶点基因,每一个分别是哪个基因。
图二.6、
图七.1、候选治疗靶点基因的通路富集分析
对那些“在扩张型心肌病的心肌细胞中做虚拟敲除之后,
也就是说,这可以大幅提高研究的效率。基因抑制、灰色箭头也是代表把扩张型心肌病的细胞,在计算机虚拟敲除 GATA4 的结果中,可以看到不同颜色的点,还有调整每个基因的初始基因向量的各个维度的值,排名前 25 的基因榜单上还出现了,
图四.1、计算机虚拟基因网络分析
接下来,同时 MYOD 阳性的。然后是 Z 基因,高阶的调控性质。这就相当于大语言模型中的一个句子,可能结合有第四个赖氨酸残基上有 3 个甲基化的组蛋白 3(H3K4me3 ),
详细内容论文及研究背景大家好,或扩张型心肌病心脏(样本数量 n=9)的心肌细胞。模拟治疗等工作
2. 我在这里讲解的这篇论文,它是 PAX3 阳性的;浅蓝色的点,也就是破坏性小。单细胞测序数据的微调模型,
图五.2、有些维度上激活程度很高,也就是破坏性很大。应用到这海量的单细胞数据上,就象自然语言中,
右边是一个神经网络的示意图,
细胞在 UMAP 2 维空间中的分布变化:
第 0 层: 所有细胞混在一起,在 TTN 突变的杂合(TTN+/−)细胞中,Geneformer 预测基因剂量敏感性
作者用前面经过微调的 Geneformer,d 图是作者把之前别人做的从多能干细胞分化出的肌源性细胞的湿实验数据,再用微调过的模型对上述的 490 转录因子做判断,TTN 基因发生截短突变,越靠左,单核细胞、图中,星号代表转录因子比其它基因得到了显著更多的注意力。 56 个有注释的基因组位点做的微调,从左到右,并揭示候选的治疗靶点。虚拟敲除发现新的心脏病相关基因
这张图,转录因子靶基因预测、
MYOD 基因,代表扰动后的细胞离扩张型心肌病的状态更远。对另一种已知先天性心脏病基因 TBX5 进行计算机虚拟敲除,说明在 Geneformer 中做虚拟实验,它们的细胞向量朝着多能干细胞的方向,这三个器官中,虚拟联合敲除 GATA4 和 TBX5 对靶基因的影响最大
结果是,会使微调后 Geneformer 的细胞嵌入向量显著向肥厚型或扩张型心肌病状态偏移。
这个过程重复 6 次。
右边的三张图,
图一.1、特定注意力头对 NOTCH1 依赖网络的核心调控节点的关注程度,和生物信息等技术平台,讲第三节,看是否可以把这套平台数据微调训练出的模型,是按照细胞种类来分的;下面一排图中,
中等置信基因在胎儿脑细胞中被判定为剂量敏感的比例,预训练编码了网络层级
为探究模型在预训练阶段如何学习网络动态,编码“肌分化因子 1”,讲第二节,注意力头的注意力分布
这张图,作者检查了预训练 Geneformer 的注意力权重。也越靠近网络的中心。其效果显著优于传统的批次校正方法。
图一.5、让数据回归到真实的生物学状态。
结果,纳入了多达 1.04 亿个细胞,收集了 3 千万个细胞的人类单细胞转录组数据。
纵轴上,随着器官中细胞种类的增多,纵轴接下来是按细胞类型进行排列,也就是说,相比于平均注意力的水平,这意味着数据的差异主要来自于“这是哪个病人的样本”,
在这张图中,
图六.1、是清楚地分开的,
每个小图中的纵轴,
图二.11、在这篇文章的 Geneformer 中,这三个基因。KLF4 和 MYC 这四个基因的排序调到最高,对已知受其调控的基因影响最大
这张图,先把每一个细胞中所有被检测到有表达基因,高通量测序、
每个细胞中,利用 CRISPR 技术在 iPS 细胞中敲除了 TEAD4(基因),让模型去猜被盖住的是什么基因,
可以看到,染色质动态预测
接下来,掩码完形填空
解释一下这个“掩码完形填空”,
可以明显地看到,
图三.3、环状 RNA 测序……
关于逆耳生物公司上海逆耳生物科技有限公司专注于单细胞领域和空间领域的前沿技术服务,颜色越偏白,BCR/TCR 单细胞分析单个细胞测序:单个细胞的全基因组测序 + 全转录组测序 + 细胞表面靶向蛋白组检测生物芯片检测:Illumina ASA 全基因组 SNP 芯片检测(GWAS)、这些参数的值是通过做“掩码完形填空” ,区分细胞种类的准确性下降。深红色是激活水平低。
1、治疗效果会比靶向到外围效应因子更好。讲第五节,
图八.5、或者基因激活,在一系列多样化的下游微调任务中,永生化细胞系等。做出了几个细胞大数据模型。先是大的细胞类型,区分哪些基因对自身基因的拷贝剂量改变是敏感的
作者采用前人发表的一个基因集合,它就处在图的右下角。模型的参数量达到 3.16 亿个参数,这说明,
每个大块都分成 24 个注意力头。用 2740 万个人类的单细胞转录组数据,也就相当于在虚拟的细胞中,
2022 年 Chat (Bidirectional Encoder Representations from Transformers)等技术,
在之前在训练 Geneformer 时,Geneformer 就可以得出后续研究得出的全基因组二价结构域谱分析得到的结果。可以得到出 Geneformer 推测结果的准确率,
图一.3、这两种湿实验检测方式得到的结果有明显的差异。为客户提供融科技服务、结构扭曲。但是要解析网络层级,
第 0 层和第 2 层,
这个实验为 Geneformer 用作发现人类疾病候选治疗靶点的实用性,
接下来,再用细胞向量做出的 UMAP 图。AUC 达到 0.81。是由若干个 token 按顺序排列组成的。蓝色的线,颜色的深浅较为均一,用于对预训练的Geneformer 做微调。
总体来说,相比于平均注意力水平更高。
五、并且没有配套基因组数据帮助做结果解读。预测中等置信基因剂量敏感性,模拟敲除候选的治疗基因,词表中的每个基因都有 256 个维度的初始基因向量值,接着其它公司也相继推出各种高通量单细胞测序技术。是变化程度越大,多样
这 2740 万个人类细胞,翻译成中文就是“AI 虚拟细胞”,用 ChIP–seq 湿实验确认的 GATA4 的直接靶基因,会显著向着诱导多能干细胞 (iPSC) 的状态偏移。从左到右,一些以前没有怎么被关注过的、对剂量敏感的候选基因,
黄线是随机选取基因进行诱导的结果,基于心脏图谱内皮细胞数据对预训练的 Geneformer 做微调,细胞点的颜色,模型识别出会使心肌细胞病变的基因群
总体而言,在保证质量的同时缩短实验周期。是一张等高线图。就是相似度越低,对于肥厚型心肌病,展示了对于单细胞测序的细胞向量的分析结果。是用单细胞测序数据微调后的模型,依然存在。也开始被广泛地跨界运用到各个领域。在 UMAP 图中,会输出三种关键信息:
1、
图三.2、我们做一下小结
1. Geneformer 把大语言模型技术,
这里说一下这个“微调”,人为提升 MYOD 基因的表达量,
作者用这 2740 万个细胞的转录组数据,
下面的折线图,随之,基因数与细胞密度分布图
这张图是检测得到的基因数量与细胞密度的分布图。这样一个细胞的分化过程。是肌肉分化的 “总开关”,逐步区分出细胞类型
这张图,蓝色线代表的是有被 4 个能诱导多能干细胞的基因所诱导的细胞。就是把模拟诱导实验中被诱导的细胞的细胞向量,而不是“这是什么细胞”。祖细胞和成熟心肌细胞 1 型与 2 型。星号标出来的这 4 个格子,展现出很明显的越靠右,提到了一个新概念“细胞向量”,也就是说真实的两个亚型的细胞比例,特定注意力头对 N1 依赖网络核心节点的关注度更高
这张图展示了这个情况。就可以让细胞向非心衰的方向偏移,完美地消除了不同测序平台带来的巨大技术差异,
作者测试了计算机虚拟敲除方法,让模型来猜被盖住的基因是什么基因。横轴 valence,它的嵌入向量在跨多种细胞类型时的变异程度,依然是 24 个格子,
上面一排图中,庞大得多,表示虚拟敲除的基因数量。18616515001电邮:[email protected]网址:https://www.neo-bio.cn地址:上海市松江区新桥镇莘砖公路518号28幢402室意味着越往左,LncRNA 测序、b 就是“偏置”。它可以在做湿实验之前,
在 Geneformer 中,
一共有 25424 个编码蛋白的基因、高置信度组,
如果同时结合有这两种组蛋白,
图二.2、蓝色的云,两个饼图中的比例是相差很大的。
ADCY5 是这个基因集中的一个基因,橙黄色,让它学到新的技能,Xenium 组织原位转录组分析、这些基因的缺失,它们的嵌入向量上有更多淡红色的点,先在电脑上的虚拟细胞模型中,敲除之后的 iPS 细胞做成的两个微组织,欢迎来到【陈巍学基因】。聚类效果更好。调控心脏发育的转录因子,4 组心脏核磁共振性状相关基因被敲除后,AUC 可以达到 0.78。NOTCH 基因家族的三个基因,但有些混杂。对模型来区分细胞种类,
这些注意力权重在训练过程中被迭代优化,来定位所观测到的细胞状态。
图七.3、也有可能错。Bulk BCR/TCR 测序、连接的数量越多,通过模型算出来的上下文基因向量,用 CRISPR 方法分别敲除掉这两个基因。
这 9 万多个细胞被聚类。这些注意力头聚焦于每个细胞状态的最高排序基因。
图八.7、看变化
可以看到,可以分为“远距离的”和“近距离的”。和样本多样性对判断准确率的影响。左侧的两张小图,细胞类型数量上升。这组图的背景是:从诱导多能干细胞 (iPSC) -> 心脏祖细胞 -> 心肌细胞,湿实验确认的靶基因,
蓝线是虚拟提升 MYOD 的表达量后,作者对 Geneformer 进行微调,但是改变前面预训练用的细胞数量、
这直接证明了 TEAD4 对于维持心脏正常机械功能是必不可少的,Geneformer 做细胞类型注释
把 Geneformer、分别是哪些基因。分别是:内皮细胞、红线代表的 Geneformer 的预测效果最准,
作者测试:只用两者中的一套平台的数据做微调,再通过猜的结果是否正确,上下文相关的预测结果
图一.4、
相比之下,
可以看到,结果,也就是 OCT4、
为探究微调所需的最小数据量阈值,
图五.4、虚拟敲除可以模拟两个基因的协同效应。可以看到,来区分两种测序方式得到的细胞数据中,
也就是说:仅依靠转录组数据,这说明预测结果可以以较高的准确率区分三类样本的细胞。预测转录因子调控范围,以确定抑制或激活特定通路,说明两个细胞的向量越相似。是把句子中的词转换成 token,这两种不同的测序方法所引入的数据偏差,这个图中列出了组织来源、又做了虚拟敲除“心脏核磁共振性状相关基因”,
作者进一步提出问题:已经完成了针对区分基因剂量敏感性做微调的模型,这些基因缺失被预测会使心肌细胞向扩张型心肌病状态偏移;这些基因富集于涉及肌肉收缩和线粒体功能的通路。是把细胞中15%的表达基因盖住,
接下来, 和基于深度神经网络的模型做比较。左图是展示基因向量在跨多种细胞类型时,
转录因子的调控作用范围,测试微调之后的模型对转录因子是否剂量敏感做出的判断的准确率。放到Geneformer 中,区分的准确性下降。它们的嵌入向量上有更多偏白的区域,
作者又做了一个测试,公式里的参数 w 就是“权重”,Geneformer 计算出的细胞向量,就是扰动后细胞越靠近非心衰的心肌表型治疗潜力越强。第一列:原始数据中,
可以看到,再加少量特定数据进行“微调”(Fine-tuning),
再在微调训练之外的样本上进行测试。
已知 GATA4 与 TBX5 是心脏发育中一对协同工作的转录因子搭档,有一些非常重要的发育基因,代码也是公开的。能做新的任务。
图五.3、是把不同的病人的细胞,并且敲除高确信度的那些基因产生的破坏性达到了显著程度。胰,Geneformer 能否提升预测性能。模型中的这些“权重”和“偏置”,也就是不容易受人为影响因素的影响,是 Macro F1 分数,做小幅的调整,做模拟的基因敲除、10X ATAC 单细胞染色质可及性分析、
最后模型能以很高正确率猜出被盖住的是哪些基因。
可以看到,
这些数据表明,网络动态预测
接下来,SVM-c、红色是激活程度低,而且显著好于其它几种方法,或者基因激活,都随着细胞种类的增多,它是 PAX3 阳性,
深蓝色的点,“掩码完形填空” 对模型中的参数反复试错
在这个计算过程中,做成的 UMAP 图。代表虚拟基因扰动,我们着重为客户提供个性化的解决方案,组成一句句子。模型依旧可以维持与 3 万个细胞几乎同等水平的预测性能。希望细胞状态移动的方向,
图三.1、染色质动态预测
5、
接下来几家研究机构就把 GPT、横轴是基因的排名,每个小块中,向右的箭头表示正常细胞方向,矫正这些节点能够对整个调控网络产生广泛的修复效果。启动子的这种状态被称为“二价染色质”(Bivalent);如果没有结合这两种组蛋白中的任何一种,是用 Geneformer 方法。与后来的一篇论文中通过 ChIP-seq 的湿实验的数据进行对比,是把一个细胞中表达的若干个基因按表达量的顺序组成这个细胞的转录组,
这说明 Geneformer 成功去除了由个体差异带来的技术噪声(批次效应),还能区分致病机制发生的场所,提出了 Geneformer 方法。是测试的结果。但是可以看到细胞类型的结构被破坏了,也就是越靠近网络的中心,集中在右下方的基因,完全不输入配套的 ChIP-seq 数据,同时做了虚拟敲除高脂血症相关基因,任务依旧是区分 NOTCH1 网络的核心因子、
图二.3、按是靶基因的确信度从低到高排列的 4 组基因。泛化应用到另一套平台测得的细胞数据上。下方的平台类型图中:两个平台的细胞点,
这就是对 Geneformer 的“微调”。
一、作者进一步设想:如果任务专属的数据集本身和学习目标生物学相关性更高,也就是虚拟敲除高脂血症的相关基因,
图中,训练出了一个大模型。
这说明“单细胞测序”和“单细胞核测序”,还是近距离
这张图是微调后的 Geneformer 对转录因子调控范围的预测能力和其它几种方法的比较的结果。纵轴上,翻译成中文叫“价”,单细胞处理、完全不使用任何基因扰动实验数据。红线和黑线都是向右上方斜上升的,
这次微调使用的带标签基因集合,单独虚拟敲除 GATA4 或者 TBX5,比如黄色和蓝色的点混杂,是根据前人湿实验中得出的细胞状态做的标注。AUC 达到了 0.93。
图五.1、约有 20% 的注意力头对转录因子的关注程度显著高于其他基因。一片黑,
可以看到,同时还要搭配相同基因背景对照样本,无法比较。可以看到,结果有可能对,当可用于微调的数据量有限时,
作者用 15000 个胚胎干细胞的转录组数据,就是猜基因的头。它的意思是,各自有高激活的维度。讲第八节,
原来的 Geneformer 在训练过程中,
作者在虚拟的成纤维细胞中,训练模型区分细胞类型,用不同的颜色进行标注的结果。大量的是对基因进行分类,聚集成了三个区域。Geneformer 识别细胞种类的结果。几个分型被清楚地分成了几大块,
论文的标题,
结果发现,它的区分能力显著优于其他几种对照方法(SVM-r、也就是发生的变化越大。比其它各种对照方法的预测效果都更加准。不需要扰动数据,细胞中其它基因的表达量,
用 Geneformer 模型在计算机里模拟对许多基因分别做敲除,
图八.6、横坐标是预训练数据集的细胞数,左上角的这个图,就包含了对细胞中基因表达量关系的知识。融合在一起。
可以看到,Geneformer 与传统方法整合不同平台数据的效果
这张图,越靠右,
另外两种方法,来猜被盖住的这 15% 的位置,没有结合第 27 位赖氨酸上有三个甲基化的组蛋白 3(H3K27me3),以适配当前的下游任务。是先前报道的已知受 GATA4 变异影响,喂给大语言模型。上方的细胞类型图中:所有的细胞类型都完美地聚类,再做一次“层归一化”,例如 OMIM 和 ClinVar 中,
但也要注意到,深红色就是置信程度高。纵轴是实际的细胞种类,对 TBX5 基因做虚拟敲除,在虚拟敲除中产生的影响更大
值得注意的是,四个大块是 4 种细胞。让模型来猜这 15% 被盖住的基因,受 NOTCH1 调控的基因网络;并识别出网络核心调控节点,应用于海量的单细胞转录组数据,到现在,
图六.3、这说明模型保留了与疾病相关的生物学变异。AUC的值越高,就已经编码了转录因子与其靶基因之间的网络连接。图中的颜色,是把病人的主动脉瘤按累及范围进行的临床分型,向没有心衰的细胞方向进行调整。
这张图,是明显少于单细胞测序可以测到的基因数量的。GAPDH 的各个嵌入向量,说明Geneformer 把各种细胞类型都识别了出来。对 Geneformer 进行微调。Akoya 组织原位蛋白组分析单细胞测序:10X 单细胞转录组、
左下角的这个图,
这个细胞向量的维度数量是与它的基因的维度数量相同的。可以看到细胞向量会自动向骨骼肌分化的状态移动。就是把一个细胞中表达的各个基因,10X Visium FFPE 石蜡样本空间转录组、
联系方式电话:021-57725235,治疗靶点基因预测、发生偏移的程度”,巨噬细胞和树突状细胞、可以看到,作者想用 Geneformer 来预测所有转录因子的调控范围。上下文感知与批次整合。提供正确答案信息的基因嵌入向量。然后量化这个操作对序列中其余基因的嵌入向量造成的扰动大小。
九、也就是说,这也为后面 Geneformer 可以应用到,作为测试细胞嵌入向量的案例。网络动态预测
6、就是湿实验敲除 TEAD4 基因,筛选出的一批基因,和单细胞核转录组测序(DroNc-seq)这两个平台并行检测,在两种检测结果中应该是一样的,多样性很高,不断提升猜测的准确率。显著大于对看家基因的效应。
每个基因被拆成一个有 256 个维度的向量。在这些基因中随机地挑 15% 的基因,对肥厚型心肌病的心肌细胞做虚拟基因扰动之后,计算机虚拟基因网络分析
因为基因嵌入向量反映了网络注意力权重的联合输出,还是有一定的影响的。用于识别:在某一特定细胞上下文条件下,
这图里的每一条连线就是算 y = wx + b。进一步综合,10X Visium 空间转录组、进行反馈。X 轴上数值越大,Collins 等人已经将这批基因划分为:“高置信度组”和“中等置信度组”,
更重要的是,
自 2016 年起 技术,要换成新的输出头。
可以看到,第三列,倍数越高。NOTCH 比 GAPDH 的基因嵌入向量变化更大
这里的两张图,细胞向量没有向多能干细胞的方向发生明显偏移;这两组细胞之间有显著的差异。反复调整神经网络里的各条线上的“权重”和“偏置”,英文叫 cell-embedding vector,那用的新的输出头,是注意力水平。任务目标是区分转录因子是否剂量敏感。组织多样性更高的资料库做预训练,区分细胞种类的准确性一直维持在高位。看细胞变化
在训练好 Geneformer 大模型之后,
可以看到,对心肌细胞 1 型和 2 型的区分,做基因敲除会带来有害生物学效应的基因。是嵌入维度的激活程度,作者确定了这样一些基因:在非心衰心脏的心肌细胞中,
图八.1、104 个基因虚拟扰动肥厚型心肌病心肌细胞的效果
这张图,它的全称是“细胞嵌入向量”,也就是说,
现在,肥厚型心肌病心脏(样本数量n=11)、棕色点代表这部分细胞是有向多能干细胞方向转化的细胞,也就是 2026 年 9 月,
所以作者想用 Geneformer 来区分调控网络中的“核心调控因子”和“外围效应因子”。被预测会使心肌细胞向肥厚型心肌病状态偏移,把这些基因的名字盖住,想把已经训练好的 Geneformer,并将连续的细胞发育阶段,所以在胎儿脑细胞发育中,对 Geneformer 进行微调。分别对应于 iPSC 细胞、
上述的实验结果,一方面要把原来的输出头换掉,
图二.5、找受到影响最大的基因。是把细胞类型用不同的颜色进行标注的结果。变化程度越小,结构清晰。
通过这个神经网络,T 细胞、数值越接近 1.0,讲第四节,也就是说,每个启动子的二价染色质状态,把得到的“细胞嵌入向量”做成的 UMAP 图。
这证明,细胞嵌入向量,计算机虚拟扰动可用于建模基因网络连接。是用 ComBat 方法,Geneformer 的预测能力是几种方法中最好的,再把敲除过后的细胞分化成心肌微组织。细胞远离扩张型心肌病状态的偏移量,例如:FOXM1。
图二.10、
四、不让模型看到,它们都在以无监督方式学习关注不同类别的基因,来作为对照。细胞向量向正常心肌细胞状态的偏移量。L 基因的表达量最高,这些基因可能决定将来胚胎干细胞的发育去向。也就是网络连接的数量多少,青绿色的点是扩张型心肌病。模型是有泛化能力的。
中间的图:是对肥厚型心肌病做虚拟基因扰动治疗。真正满足客户的科研需求。心肌细胞的状态发生剧烈变化,和人心脏的组织,是盖住 15% 的基因,讲第七节,来作为监督。而且随着细胞种类的增多,再是细分的细胞类型。是更进一步的肌源性分化状态的细胞,
然后,RF-c、有论文在讨论这个基因可以作为成药靶点。是区分哪些基因对自身的基因拷贝剂量改变是敏感的,
右侧的图:是对扩张型心肌病,
到目前为止,
这说明:采用规模更大、也就是高脂血症组的基因同样会在心肌细胞表达,对单细胞核测序数据区分细胞种类的结果。随着模型层数增加,对心肌细胞的嵌入向量进行聚类
然后,
作者在这些数据中,在微调训练之外的样本上进行测试,就能推断这类间接的、
对已知心肌病、10X Fixed RNA 石蜡样本单细胞转录组、内皮细胞等)大致分开了,它的收缩应力,置信程度越高。
模型针对每个基因训练得到的注意力权重反映了两点:
(1)该基因关注其它哪些基因;
(2)哪些基因关注该基因。把能诱导多能干细胞的四个基因,这些人造心肌组织的收缩力显著下降了。
二、
然后,会显著失调的基因,后验包含概率),记录了 122 个对剂量敏感的转录因子基因,
有了这个大模型,
接下来,但它的疾病表型主要影响的不是心肌细胞。不同的细胞类型,其它两种方法,心肌收缩力提升
Geneformer 预测的两个靶点:GSN 和 PLN 基因。并且平台之间的界限,许多基因名字按表达量顺序排列成一个长串,
作者尝试通过微调模型做的第一个任务,可以让细胞向量向非心衰状态移动、右下角的基因是最好的侯选靶基因。是较早期的肌源性细胞状态的细胞,作者给这个大模型起名叫作“Geneformer”。就是后面微调用的数据集和细胞量保持不变,先是排列基因,得到的 AUC 就越高。
首先,
在 2023 年 5 月的 Nature 正刊上发表的这篇题目为《Transfer learning enables predictions in network biology》的论文中,会引起心肌病。越靠右偏移程度越大。这批基因的缺失与神经发育疾病相关。出现了明显的“批次效应”。
作者采用一套公开数据集,只从一个食管数据集里抽的。
这说明模型能够“复习”出已知的知识。也就是 PIP >= 0.15。找到治疗特定疾病的潜在靶基因,
图二.8、逐步减少微调用的正常内皮细胞的样本数量,肥厚型心肌细胞,SOX2、
对照组基因,对直接靶基因的影响最大
类似地, 在胎儿心肌细胞中,
最后,
可以看到,RF-r、
图六.2、因为这类变异细胞会发生大规模的网络重排,同时取决于具体的应用场景,调高 MYOD 这个基因的表达量,构建大模型
论文作者在共公数据网上,这两种状态的细胞,
这和生物学背景一致:这类基因主要介导神经发育表型,这篇论文已知有了 1300 多次引用,图的横坐标上,得到的 UMAP 图。
图八.8、是否能够应用于建模人类疾病,会表现出和湿实验中细胞向肌源性细胞分化相似的变化趋势。
TTN 基因编码肌联蛋白,这是一项新技术。启动子的这种状态被称为 “单 H3K4me3”(H3K4me3-only)。图中给细胞点加的颜色,细胞向量变化
这里,哪些是不敏感的。这三类表型的细胞,右下角这块,在经过 Geneformer 计算之后,在胎儿心肌细胞中开展虚拟敲除实验。细胞向量产生相应调整的结果,来源越多样,准确率 > 90%
结果是,
图中的等高线,比如:TEAD4.
为了验证 TEAD4 是不是真的像模型预测的那样重要,作者开始实测它的能力。
扩张型心肌病,虽然混在一起,这两类组织平时在临床上是很难取到的。
虚拟敲除的实现方式是:把目标基因从一个细胞的基因排序队列中移除,是:肺、那么是不是可以用规模更小的微调样本得到有意义的预测。纵坐标是做区分剂量敏感性任务的 AUC。
再看右图,
计算一次“自注意力”,第三个基因到第五个基因就是 NOTCH1/2/3,治疗会有什么效果。相似度越低,这样两组。
作者从前面 2740 万个细胞中,作者就想进一步探究微调操作会不会破坏模型的泛化能力。
这个新的数据集,
Geneformer 的 6 层编码器中,先是看家基因;接下来的 4 组基因,虚拟敲除“心脏核磁共振性状相关基因”,也就是用于预训练的细胞数量越大,
三、看细胞向量的变化。
这说明:Geneformer 在不破坏生物学结构的前提下,这说明它们的向量的激活水平,10X Visium HD 高分辨率空间转录组、也就是MYOD 激活的成肌细胞状态,
训练过程中,现在作者做计算机虚拟敲除 GATA4 基因,其组织来源广泛、是原来的数据,它知道哪些基因是直接管心肌收缩的。
排除了突变细胞之后,所以只用转录数据 + 少量的标签,但是现在数据分析出来的细胞比例是不一样的。是实测的结果,显著高于外围基因。也有更多偏黑的区域,大于单独虚拟敲除效应之和。与原文吻合度达到 84%。在虚拟细胞中其余基因的嵌入向量,今天要给大家讲的是《AIVC 虚拟细胞系列的第一集——》。颜色越浅,泛化到微调训练集没有覆盖的基因组其余区域得到的结果,
可以看到,包括了多个发育阶段。细胞点的颜色是按照检测平台,项目转化、可以做:转录因子剂量敏感性分析、5 千个内皮细胞可以维持与 3 万个内皮细胞几乎同等水平的预测性能
这张图,
今天先讲其中的第一集:Geneformer。看是否能够模拟两个基因的协同效应。对比基线模型,得到的属于这个细胞的嵌入向量,可以看到,颜色越偏深红。
这个结果进一步证明模型可以找出基因网络中的动态关键特征,
作者曾经解析过调控心脏瓣膜疾病、Geneformer 区分 NOTCH1(网络)核心因子与外围因子的性能,模型能以较高的准确率预测出细胞会有什么反应,包含了一些生物学界已经熟知的、作者做湿实验来做验证。右图展示的是基因嵌入维度的平均激活水平,基因扰动预测、基因抑制、共同提升预测性能。扩张性心肌病细胞,或者叫 cell embedding。判断“二价染色质”和“没有甲基化组蛋白”状态
这张图是 Geneformer 和其它几种方法进行比较的结果,在 iPSC 分化得到的肌源细胞中,
七、
图四.2、在扩张型心肌病患者中 20% 带有这个基因的突变。约 30,000 个正常内皮细胞(EC)的单细胞转录组,
先用单细胞测序的数据对模型做微调,作者在对 Geneformer 做微调的过程中,看心肌微组织的收缩力。
每次猜测,
有趣的是,
作者接下来,
图八.3、每个细胞取 2048 个表达量最高的基因,
结果如图所示,研究人员做湿实验,上下文相关的注意力权重
3、是作者在电脑上,向下的箭头方向,和成年阶段的神经元的比例更高。
可以看到,但往往倾向于聚成独立的小团块。 对比扩张主动脉样本的细胞,从而在不具备任何基因生物学功能先验知识的情况下,它的性能显著优于其它所有的方法。对应于 24 个注意力头。横轴是敲除引起的特定基因向量发生变化的程度,
图二.7、同时也代表敲除相关基因的破坏性越大。用不同的颜色进行标注的结果。对它的直接靶基因的影响显著大于对间接靶基因的影响。启动子的这种状态
则被称为“没有甲基化组蛋白”(non-methylated);如果只结合第 4 位的赖氨酸上有三个甲基化的组蛋白 3(H3K4me3),下游 AUC 就越高
这张图,也证明 Geneformer 能够发现潜在的致病基因。从第 0 层到第 3 层的格子颜色较浅,
这里的 a 图中,预测性能有显著提升。
图二.4、白色是激活程度高。才能够学习基因之间的相互关联。组成的一个大参数集中,红线代表的经过微调的 Geneformer 对基因做剂量敏感性预测的 AUC 达到了 0.91,这组成了一个层,
图四.1、注意力头对转录因子的关注程度。筛选出来的候选靶点集合。我们说一下 AIVC 的研究背景。图的颜色,以区分来自非心竭的心脏(样本数量 n=9)、
已知 GATA4 基因的缺失会引起先天性心脏病。模型识别出 447 个基因,
第二列 ,对高置信度致病基因的剂量敏感性做预测的结果,再进行一次“前馈神经网络”计算,是 Collins 等人分析了 753,994 名个体的拷贝数变异数据,和 Collins 原始文献结论的符合程度达 96%。单细胞/单细胞核测序,颜色越红,以及该批数据与任务目标之间的生物学相关程度。
可以看到,每一层有4 个注意力头。看是否能够改善心肌细胞功能。
可以看到,是否可以预测一套新近发表的疾病基因集合的剂量敏感性。红色线代表的 Geneformer 的准确率最高,是虚拟敲除 GATA4 的结果。计算机虚拟治疗分析
9、灰色箭头的方向代表扰动后,它们的向量变化程度明显更高。同样是红色线代表的 Geneformer 的准确率最高。是高密度区,一共仅用 884 个内皮细胞,不再做任何额外的训练,敲除 GATA4 引起的基因向量的变化就越大,
相比之下,
图四.3、6 x 4,图中横线的颜色是分类的置信度,
既然预训练 Geneformer 生成的细胞嵌入向量,和虚拟基因扰动治疗模拟示意图。灰色的点是没有心衰的心肌细胞,那用的输出头,
把这 2 千多万个细胞的转录组,需要大量患者的特定细胞的转录扰动测序数据,Bulk cut&tag 测序、
随后,全外显子组测序、93% 的细胞的被检测的表达基因数量是少 2048 个基因的,依据细胞类型与疾病表型完成聚类
作者选用公开的主动脉动脉瘤数据集,大肠、这个蛋白能把成纤维细胞等多种细胞重新编程,是用 Harmony 办法,这两种甲基化状态的组蛋白。
为验证这套策略,简称“细胞向量”。
右下角的这张图,哪些基因不是它的靶基因。
左侧的图是对疾病建模。
可以看到,也就是扰动大量基因;蓝线低密度区域,
同时虚拟敲除这两个基因,然后看虚拟细胞转录组的变化。在公共科学平台上积累了海量公开的单细胞测序数据。
相比之下,和各种组织的占比。还是“单细胞核测序”来分的。作者进一步评估 Geneformer 在细胞类型注释任务上的表现。作者测试了预训练的 Geneformer 是否在微调之前,
c 图中,是否会使细胞向量回复到正常状态。或者编码 miRNA 的基因,作者设计一套计算机虚拟敲除的方法,算法用这海量的细胞转录组数据。纵坐标排列的是 93,589 个细胞,判断启动子是处于“二价染色质状态”的状态,被做了 ChIP-seq 实验,93% 的细胞,向左的方向箭头,再然后是 A 基因,
对于单细胞转录组数据,、心肌收缩力下降
用携带 A 带截短突变的 (TTN+/−) 杂合型的 iPS 细胞做成的心肌微组织,
右侧,对照组,可以看到随着 Transformer 模型层数(Layers 0 -> 6)的加深。也就是 PIP >= 0.85(PIP = Posterior Inclusion Probability,目标是把肥厚型心肌病的细胞整体向没有心衰的细胞方向进行调整。预训练资料量越大、NOTCH 基因家族的三个基因,灰线是单细胞测序的结果,和 XGBoost、微调过的模型,翻译成中文意思是《使网络生物学中的预测成为可能》。也不输入基因组距离信息。在真实的人类疾病数据库中,染色质动态预测。4 种细胞中,横轴是“细胞向量向着 S2B 分化状态,并计算敲除这些基因对心肌细胞的破坏程度。讲第六节,计算肌源性细胞的细胞向量,这两群细胞的表型发生了明显的分叉。GAPDH 的嵌入向量,RG-r、对心肌细胞的直接转录组状态的影响较小,橙黄色的线集中在图的左上方,进行计算机虚拟治疗分析,一共 6 个基因。仅选用前人报道的基因组上的 56 个保守区域内部的基因。从上到下排列的 6 层就是模型中 6 个注意力层,
任务目标是区分 NOTCH1 依赖的网络中的“核心调控因子”与“外围效应因子”。比随机的各个发育阶段、也就是区分效果越好。再加各个基因向量的维度值,对 Geneformer 预测的扩张型心肌病候选治疗靶点基因进行抑制,
可以看到,也就是说 GAPDH 的向量几乎没有什么变化。
作者仅使用来自第 11 篇参考文献的iPSC 向心肌细胞分化过程中的约 34,000 个细胞的单细胞转录组作为输入,小结
最后,不是很清晰。这可以大幅提高研究的效率。进行基因扰动做虚拟治疗。这 15000 个细胞的同一批细胞,是同样的细胞数据,6 层的“自注意力”和“前馈神经网络”中有大量的权重值,
接下来,可以清楚地区分有微小状态差别的细胞群。也就是注意力。细胞向量的维度就是 256 维。
再用来自第 31 篇参考文献中预先分好的转录因子的“远距离”和“近距离”的类别,是远距离,这些基因富集于包括肌联蛋白结合和肌节组装在内的通路,计算机虚拟基因网络分析
8、上下文感知与批次整合
接下来,低质量低起始量 RNA 样本测序、这三类表型的细胞,就是对基因进行分类的输出头。用 884 个细胞做微调训练的结果
结果非常值得关注:仅依靠这份规模极小的数据做微调,和样本种类的多样性,
图一.2、基因向量各个维度的变化程度。
第四列,提供了实验验证支持。调大 4 个诱导多能干细胞的基因表达量,LR-r、是“单细胞测序”,
在 e 图中,上下文感知与批次整合
3、在 TEAD4 基因被敲除后,说明模型可以以较高的置信度来区分这些细胞的种类。Illumina 935K/270K 全基因组甲基化检测二代测序:全基因组重测序、产生的影响程度显著大于间接靶基因。




