你的猫可能正在用一种你看不见的方式改写你的基因
你的猫可能正在用一种你看不见的方式改写你的基因全球大约有三分之一的人感染了弓形虫(Toxoplasma gondii)。你可能从来没做过检测,没有任何症状,完全不知道自己体内有这种寄生虫。但它可能正在做一些你看不见的事情——不是直接伤害你,而是悄悄改变你肠道细胞的基因表达模式。 2026 年 4 月 11 日,Zhai 等人在 Parasites & Vectors 上发表了一项研究,详细描述了弓形虫感染猫的小肠后,microRNA(微小 RNA)的表达发生了怎样的动态变化。这项研究的对象虽然是猫,但它所揭示的机制对理解弓形虫如何操控宿主有更广泛的意义。 弓形虫:操控宿主的”隐形玩家”弓形虫的故事在寄生虫学中是一个经典案例。 它的最终宿主是猫科动物——弓形虫只能在猫的肠道中完成有性生殖。但它可以感染几乎所有温血动物作为中间宿主:老鼠、鸟、人、甚至海洋哺乳动物。 弓形虫最出名的能力是操控宿主行为。 感染了弓形虫的老鼠不再害怕猫的气味——甚至可能被猫的气味吸引。这显然有利于弓形虫:老鼠更容易被猫吃掉,弓形虫就回到了它的最终宿主体内。 这种行为操控的机制一直是研究的热点。弓形虫在感染过程中会在宿主细胞内形成”包囊”(cyst),长期存在于大脑和肌肉组织中。这些包囊持续释放信号分子,可能通过改变神经递质代谢、炎症反应、或者表观遗传修饰来影响宿主的行为。 但弓形虫的第一个战场...
你的基因突变会导致什么症状?一个模型能直接预测
你的基因突变会导致什么症状?一个模型能直接预测当一个基因发生突变时,临床医生通常需要判断两件事:第一,这个突变是不是有害的;第二,如果有害,它会导致什么具体症状。 第一个问题(致病性判断)已经有相当成熟的工具了——CADD、REVEL、AlphaMissense 等模型可以给突变打一个”致病分数”。但第二个问题(表型预测)一直难得多:同样是”致病”突变,一个可能导致心脏病,另一个可能导致智力障碍——模型怎么区分? 2026 年 4 月 14 日,Wen 等人在 Nature Biomedical Engineering 上发表了 PheMART,用对比学习来预测错义突变的具体表型后果。它不只是告诉你”这个突变有害”,还告诉你”它最可能导致哪些症状”。 问题比你想的更难一个错义突变——也就是 DNA 上的一个碱基变化导致蛋白质中一个氨基酸被替换——可能产生的表型后果千差万别。 同一个基因的不同突变可能导致完全不同的疾病。比如 CFTR 基因的某些突变导致严重的囊性纤维化,另一些突变只导致轻微的胰腺功能不全。反过来,不同基因的突变也可能导致相似的表型——比如多种不同基因的突变都可能导致心肌病。 这意味着”突变→表型”的映射不是简单的线性关系。 它涉及蛋白质结构的变化、蛋白质功能的改变、细胞通路的扰动、组织层面的效应——每一层都有复杂的非线性关系。 大多数现有工具回避了这个问题。...
RNN 退役了吗——它和 Transformer 在生信中的真实分工
RNN 退役了吗——它和 Transformer 在生信中的真实分工在前面两篇文章中,我们分别讨论了 RNN/LSTM 为什么适合生物序列数据(开篇),以及它们在细胞轨迹推断中的角色(代表工作)。 这个批次的最后一节要回答一个很多人心里其实一直在想的问题:Transformer 不是已经赢了吗?RNN 还有存在的必要吗? 这个问题之所以值得认真回答,是因为它背后藏着一个更一般性的思考:在生物信息学中,技术演进的逻辑到底是什么——是”新的替代旧的”,还是”不同的解决不同的”? 先看 Transformer 做到了什么Transformer 在生物信息学中的影响是真实的,不需要回避。 蛋白质语言模型是最成功的案例。ESM-2、ProtTrans 等模型在大规模蛋白质序列数据库上预训练后,可以在零样本条件下预测残基接触图、蛋白质功能、突变效应。这些模型不需要多序列比对(MSA),不需要标注数据,只靠一条氨基酸序列就能给出有生物学意义的预测。 DNA 语言模型——DNABERT、Nucleotide Transformer——在转录因子结合位点预测、剪接位点识别等任务上展示了比传统 CNN 更强的泛化能力。 单细胞基础模型——scGPT、scBERT——将基因表达谱视为”文本”,通过自注意力机制学习基因之间的共表达关系,在细胞类型注释和轨迹推断上表现出色。 AlphaFo...
细胞走过的路,RNN 还记得——轨迹推断里的循环网络
细胞走过的路,RNN 还记得——轨迹推断里的循环网络在上一篇文章中,我们讨论了为什么生物序列数据天然适合用循环网络来处理。DNA、RNA、蛋白质都是一维序列,碱基和氨基酸的排列顺序本身就携带信息,而 RNN 的设计恰好对应了这个特征:按顺序读取、维护上下文状态、逐步积累信息。 这篇文章要讨论一个更具体的问题:在单细胞生物学中,有一类任务的核心挑战恰好是”顺序”——这就是细胞轨迹推断。 问题:我们只看到了”快照”单细胞 RNA 测序(scRNA-seq)是一项改变了生物学研究方式的技术。它可以在一次实验中同时测量数千个甚至数万个细胞的基因表达状态,让我们看到一个组织中所有细胞的”全景图”。 但这项技术有一个根本性的限制:它是破坏性的。 测序过程会裂解细胞,所以我们没办法对同一个细胞在不同时间点重复测量。我们拿到的是一张”快照”——所有细胞在某一时刻的状态,而不是每个细胞从出生到现在的完整记录。 这就带来了一个核心问题:从一张快照中,能不能推断出细胞走过什么路? 比如,我们拿到一批造血干细胞和各种成熟血细胞的混合样本。我们知道这些细胞处于不同的分化阶段,但不知道哪些细胞正在分化成什么,也不知道分化的路径是什么样的。这种从静态数据推断动态过程的任务,就是”轨迹推断”(trajectory inference)。 RNA velocity:从”未完成的转录本”推断方向2018 年...
你拍了一张照片,但其实能看到整条时间线
你拍了一张照片,但其实能看到整条时间线假设你走进一家幼儿园,只拍了一张照片。照片里有正在哭的、在玩积木的、在排队等午饭的、在午睡的。你没见过这些孩子从早到晚的完整日程,但你能从每个人正在做的事情来推断:哭的那个可能刚被送来,午睡的那个可能已经在幼儿园待了大半天。 单细胞生物学家面对的困境,和这差不多。 问题出在哪单细胞 RNA 测序是最近十年最有力的生物学工具之一。它的能力很惊人:一次实验可以同时测量一万个细胞的基因表达状态,让你看到一个组织中所有细胞的全景。 但它有一个根本性的限制:测序会杀死细胞。 你没法对同一个细胞测两次。所以你拿到的永远是一张”快照”——所有细胞在某一时刻的状态。而你想知道的是:干细胞是怎么变成血细胞的?皮肤细胞在受伤后怎么重新编程回祖细胞状态的?肿瘤细胞怎么一步步获得转移能力的? 这些”怎么变”的问题,本质上是时间问题。但你的数据里没有时间。 2019 年的一项研究为此提供了一个思路。 Schiebinger 等人在 Cell 上发表了 Waddington-OT,用一种叫”最优传输”的数学工具来推断细胞分化路径。它的基本想法是:如果你有早期和晚期两个时间点的细胞数据,就能用最优传输算法找到从早到晚的最优”搬运方案”,这个方案就对应了分化的路径。 这很聪明,但它有个前提:你得有两个时间点的数据。 只有一个时间点怎么办2025 年底,Tronsta...
你每个细胞里有几千个核糖体工厂,有个东西专挑其中一个位置插入
你每个细胞里有几千个核糖体工厂,有个东西专挑其中一个位置插入你身体里的每个细胞都含有数千个核糖体基因的拷贝。它们串联排列在染色体上,像一排排相同的工厂,日夜不停地生产蛋白质合成的核心机器。这些工厂几乎一模一样,只有一个微小的位置——大约在 28S 核糖体 RNA 基因的第 2384 个碱基附近——在数十亿年的演化中被同一种东西反复瞄准。 这种东西叫 R2 逆转录转座子。它不是随机跳跃的,而是精确地、固执地、在所有拷贝中找到同一个位置,然后把自己插进去。 2026 年 4 月 14 日,Hassan 等人在 Genome Biology 上发表了一项研究,对动物界的 R2 做了迄今最大范围的调查。他们发现,这种看似简单的”寄生虫”的故事,比任何人预想的都要复杂。 一个精明的定居者大多数转座子在基因组中的行为像是流浪汉——随机找一个位置插入,有时候中断了重要基因,有时候插在无所谓的区域,一切都是运气。 R2 不是这样。 它专门插入 28S rRNA 基因中的一个高度保守位点。28S rRNA 是核糖体大亚基的核心组分,而核糖体是所有细胞制造蛋白质的工厂。在大多数动物中,28S 基因以数百到数千个拷贝串联排列在核仁组织区。这意味着 R2 插入一个拷贝后,其他几百个拷贝仍然正常工作——宿主细胞不会因为这一个被感染的拷贝而死亡。 这就是 R2 的策略核心:找到一个多拷贝基因中的一个保...
病毒一复制自己,就暴露了靶心
病毒一复制自己,就暴露了靶心你的细胞有一套抗病毒系统,但它不是简单地抓住病毒然后消灭——它更像一个狙击手,等病毒开始干活的时候,在病毒基因组最关键的位置精确制造损伤。 2026 年 4 月 14 日,Miskei 等人在 Genome Biology 上描述了这个机制的细节。他们发现,当单纯疱疹病毒 1 型(HSV-1)在细胞核里转录自己的基因时,会在 DNA 上形成一种叫 R-loop 的特殊结构。这些 R-loop 不是意外,它们是转录过程不可避免的副产品。但正是这些不可避免的结构,被一种叫 APOBEC3 的宿主蛋白精准利用,在病毒基因组上制造大量突变。 病毒要复制就必须转录,转录就一定产生 R-loop,R-loop 暴露的单链 DNA 恰好是 APOBEC3 的完美靶点。 这是一个结构性的陷阱——病毒的生存策略本身就包含了自我暴露的环节。 先说说 R-loop 是什么DNA 在正常情况下是双螺旋——两条链缠在一起。但在基因转录的过程中,其中一条 DNA 链会和正在合成的 RNA 短暂配对,形成一个 DNA-RNA 杂交体。这时另一条 DNA 链就被迫”晾”在外面,变成单链。整个结构像一个环,所以叫 R-loop。 R-loop 在正常转录中很常见。 它们在基因的起始和终止区域自然形成,在 GC 含量高的地方更容易出现。细胞有一套机制来清除它们——解旋酶、RNA 酶...
为什么生物序列数据天然适合循环网络来读
为什么生物序列数据天然适合循环网络来读在深度学习进入生物信息学之前,处理生物序列数据的主要方法是位置权重矩阵、隐马尔可夫模型和条件随机场。这些方法各有优势,但有一个共同的局限:它们对序列中元素之间依赖关系的建模能力有限。 20世纪90年代,循环神经网络(RNN)开始被引入生物序列分析。和之前的方法不同,RNN 天然地按顺序处理输入——它一个一个地读取序列中的元素,每读一步就更新一次内部状态,这个状态就相当于对”到目前为止读过的内容”的记忆。 需要先说明一个前提:RNN 和 LSTM 并没有”过时”。 Transformer 的热度让很多人觉得循环网络已经是被淘汰的技术。但在生物信息学的实际工作中,RNN/LSTM 到今天仍然在特定场景下有不可替代的价值——不是因为怀旧,而是因为有些生物问题的计算特性恰好就是 RNN 最擅长的那一种。这篇文章要解释的是:为什么 RNN 适合处理生物序列,它的核心能力是什么,以及这个逻辑在今天还成不成立。 生物序列的”顺序性”DNA、RNA、蛋白质都是一维序列。但它们和一段随机的字符串不同——序列中元素的排列顺序本身就携带了重要的生物学信息。 密码子的阅读框。 核糖体翻译 mRNA 时,每三个碱基读成一个密码子,决定一个氨基酸。如果阅读框偏移一个碱基,整个蛋白质序列就完全不同。这意味着,碱基之间的相对位置不是无关紧要的——相邻三个碱基...
你的基因组里有40%是"僵尸"序列,它们可能在加速你的衰老
你的基因组里有40%是”僵尸”序列,它们可能在加速你的衰老你的基因组里,大约有40%的序列来自一种叫做”转座子”的遗传元件。这些序列曾经是能够在基因组中跳跃复制的”寄生者”,在数百万年的演化中不断拷贝自己,堆积在你的 DNA 里。大多数转座子在漫长的沉默过程中已经失去了跳跃能力,变成了基因组中的”僵尸”——不会动,但还在那里。 一个看起来违背直觉的问题是:这些”僵尸”序列还能影响你吗? 最近一项预印本研究给出了一个让人意外的回答:能。而且,抑制它们的活性可能与延缓衰老有关。 什么是转座子转座子是一类可以在基因组中移动或复制自身的 DNA 序列。它们最早由芭芭拉·麦克林托克(Barbara McClintock)在20世纪40年代的玉米实验中发现,这一发现后来为她赢得了1983年的诺贝尔生理学或医学奖。 转座子主要分为两大类: DNA 转座子通过”剪切-粘贴”机制移动——把自己从基因组的一个位置切下来,插入另一个位置。这类转座子在人类基因组中大多已经失活。 逆转录转座子通过”复制-粘贴”机制移动——先把自己的 DNA 转录成 RNA,再通过逆转录酶把 RNA 逆转录回 DNA,插入基因组的新位置。这类转座子在人类基因组中占了大约34%,其中最丰富的是 LINE(长散布核元件)和 SINE(短散布核元件,包括 Alu 元件)家族。 需要说明的是:说”40%是转座子”不等于”40...
细胞里没有墙的"房间"是怎么运转的
细胞里没有墙的”房间”是怎么运转的如果让你想象一个细胞的内部结构,你可能会想到教科书上的图:线粒体、内质网、细胞核——每个细胞器都有膜包裹,像是一个个独立的房间。 但近十年来,细胞生物学领域发现了一类新型的细胞内结构:它们没有膜,边界模糊,看起来像是液体在细胞质中形成的”液滴”。这些结构被称为生物分子凝聚体(biomolecular condensates),它们的形成机制叫做液-液相分离(liquid-liquid phase separation,LLPS)。 这些”无膜小房间”的发现,正在改变我们对细胞如何组织自身活动的理解。 什么是液-液相分离液-液相分离是一个物理化学概念:两种或多种液体在特定条件下分离成不同的相。最常见的例子是油和水——把油滴入水中,油不会溶解,而是形成独立的液滴。 细胞中也存在类似的现象。某些蛋白质和核酸分子之间通过多价相互作用(多个弱相互作用位点的同时结合)聚集在一起,形成一个密度更高的”浓相”,从周围的”稀相”中分离出来。这个过程不需要膜的参与,形成的结构具有液体的特征——可以融合、可以流动、可以内部交换成分。 需要说明的是:把细胞内结构比作”油滴在水中”只是帮助理解,不代表真实情况就这么简单。 细胞内的相分离涉及复杂的生物分子相互作用网络,受到温度、浓度、离子环境、pH 值等多种因素的调控,远比油水分离复杂。 细胞中有哪些无膜凝聚体早在...