BoHuYeShan

Back

系列的最后一块拼图。前三篇走完了统计、转录组、群体遗传、基因组、表观和空间组学,这一篇收剩下的三大块:分子的层面(蛋白结构域、分子互作、湿实验验证,104-114)、群落的层面(微生物生态、代谢组与宏基因组,115-123),以及方法的层面(深度学习归因、蛋白语言模型、泛基因组图这些近几年的新图型,124-128),最后用五张统计杂图收尾(129-133)。编号 104-133,共 30 张

规则不变:四段式讲解,图下折叠块里是原样 CSV 或代码即数据源,全部为 WSL 里 Python 3.14 + matplotlib 渲染的模拟数据,脚本在仓库 tools/bio-plots/ch10c_more.pych10d_more.py

本系列已出七篇:第一篇(41 张,统计与转录组临床) · 第二篇(33 张,群体遗传与基因组) · 第三篇(29 张,测序、表观与空间组学) · 第四篇(30 张,蛋白、生态与 AI 多组学) · 第五篇(40 张,蛋白结构、变异与表达验证,含真实 PDB 结构与交互 3D) · 第六篇(22 张,真实公开数据实战) · 第七篇(190 张图 Nature 风格重构与方法选型)

自推一句:蛋白理化性质、结构域解析、结构置信度这些在 Linxira Bio SDK(我主导开发的本地优先生信工具链)里是版本化能力:正式分支 v1.0.1 已提供 structure pdb --alphafold-plddt 等 CLI 与 35 个 agent skills,官网拆解文随时可翻。免责声明:本文所有配图均为模拟数据的教学演示;SDK 实际可用的分析能力,请以仓库正式分支的最新 release 为准——文中部分图对应的分析尚在开发路线中,目前仅存在于本地开发分支,未合并进正式分支、代码未公开。

一、地图#

{% mermaid %} flowchart LR START([“第四篇 · 30 张”]):::hub subgraph A[“① 蛋白 分子互作”] direction TB A1[“结构域 · pLDDT · RMSF”] A2[“自由能面 · EMSA · 亚细胞”] end subgraph B[“② 生化湿实验”] direction TB B1[“双倒数 · DSF · ELISA”] B2[“荧光位移 · 双荧光素酶”] end subgraph C[“③ 微生物 生态”] direction TB C1[“稀疏化 · rank-abundance · 三元”] C2[“RDA · LEfSe · 时间杀菌”] end subgraph D[“④ 代谢 宏基因组”] direction TB D1[“镜像质谱 · VanKrevelen · Blob”] end subgraph E[“⑤ AI 多组学”] direction TB E1[“MOFA · 归因 · 蛋白嵌入”] E2[“泛基因组图 · 跨组 UMAP”] end subgraph F[“⑥ 统计杂图”] direction TB F1[“漏斗 · 哑铃 · 瀑布 · 帕累托 · 3D-PCA”] end START —> A —> B —> C —> D —> E —> F classDef hub fill:#1f4e79,color:#fff,font-weight:bold {% endmermaid %}

表 1 蛋白、互作与湿实验(104-114)

回答什么问题横轴纵轴或编码常用工具
结构域架构图功能域怎么排布氨基酸位置域方块SMART/Pfam
pLDDT 曲线结构模型哪段可信残基分段着色置信度AlphaFold DB
RMSF 曲线哪段柔性大残基位移 RMSFGROMACS
自由能面构象盆地有几个PC1PC2 等高线GROMACS
EMSA蛋白结不结合探针泳道条带迁移手绘/成像
亚细胞定位图蛋白去哪个区室荧光位置示意共聚焦
双倒数图抑制剂是哪种类型1/[S]1/v 直线族GraphPad
DSF 熔解曲线配体稳不稳定蛋白温度荧光+Tm 位移GraphPad
ELISA 标准曲线含量怎么回算浓度(log)OD450 4PLGraphPad
荧光光谱位移结合有没有发生发射波长峰移+淬灭荧光仪
双荧光素酶柱状启动子激活多少构建分组LUC/REN 比值GraphPad

表 2 生态、代谢、AI 与统计(115-133)

回答什么问题横轴纵轴或编码常用工具
稀疏化曲线测够了没有抽样 reads观测 ASV 数QIIME2
rank-abundance群落均匀度物种秩丰度(log)R vegan
三元相图三个区室比例三角坐标点位=组成R Ternary
RDA 排序图环境因子怎么塑造群落RDA 轴样方+因子箭头vegan
LEfSe 分支图哪些分类元驱动差异环形着色LEfSe
时间杀菌曲线抗生素杀得快不快时间log10 CFUGraphPad
镜像质谱图谱图对上了没有m/z上下镜像强度GNPS
Van Krevelen 图化合物属于哪类H/CO/C 分区R FTMSPlot
Blob 图bin 是谁、好不好GC%覆盖度+大小BlobToolKit
MOFA 因子图多组学共变结构Factor1Factor2+R2MOFA2
归因轨迹图模型看重哪些碱基启动子位置归因分着色TF-MoDISco
蛋白嵌入 UMAP家族聚不聚团UMAP1UMAP2 按家族着色ESM/ProtTrans
泛基因组图样本间结构变异节点路径图Bandage/pggb
跨组 UMAP多组学结论一致吗UMAP 轴三联小倍数MOFA/totalVI
漏斗图Meta 结果有偏吗效应量标准误+伪置信带metafor
哑铃图两时点差多少NES 值成对连线手绘
瀑布图个体响应排序基因型变化率着色手绘
帕累托图主要矛盾是哪几项类目计数+累计%手绘
3D PCA第三轴有无信息PC1-3三维散点sklearn

二、蛋白与分子互作#

2.1 蛋白结构域架构图#

结构域架构

它回答什么问题:家族成员的功能域怎么排布、长度差在哪——基因家族论文三件套(树、motif、结构)的最后一环,也常是审稿人判断注释对不对的第一眼。

怎么读:每行一个蛋白,灰色细线是全长,彩色方块是功能域,横轴就是氨基酸坐标,域的宽度=长度。读三样:域的完整性(FaBZR1 的 bHLH DNA-binding 在 168-232,缺了它注释就是错的);域的排列顺序在成员间是否保守(顺序换位提示结构变异);以及低复杂度区/固有无序区的长尾巴(画成空档,别硬塞个域上去)。家族论文的标准句式是「所有成员均含有 X 个保守结构域,结构域排列顺序一致」。

用什么画:Pfam/SMART 批量扫描后用 TBtools、R 语言 drawProteins;重绘按坐标表画方块。

图注示例

图 104 FaBZR1、FaDWF4 与 FaCHS 的结构域架构(模拟)。方块为预测功能域,横轴为氨基酸位置;三个蛋白均含各自家族的完整催化域,域排列顺序与典型成员一致。

展开查看:结构域坐标与绘图代码
protein,domain,start,end
FaBZR1,N-terminal activation,1,120
FaBZR1,NLS,132,148
FaBZR1,bHLH DNA-binding,168,232
FaDWF4,P450 domain,38,96
FaDWF4,substrate-binding,210,292
FaDWF4,heme-binding,452,486
FaCHS,chalcone synthase N,60,178
FaCHS,thiolase fold,190,352
csv

绘图代码(Python,独立可运行)

2.2 AlphaFold pLDDT 置信度曲线#

pLDDT 曲线

它回答什么问题:AlphaFold 模型哪几段能信、哪几段是「随机面团」——用结构之前先看 pLDDT,这不是可选项而是纪律。

怎么读:横轴残基,纵轴 pLDDT(0-100),官方配色:深蓝大于 90(很高,原子级可信)、浅蓝 70-90(骨架可信)、黄 60-70(只可看趋势)、橙小于 60(无序/不可信)。本例 1-43、103-195 与 217-238 三段高置信(pLDDT 不低于 87),46-100 一段走低,其中 64-85 八个位点全部低于 60(谷底 47.9)——那是一段固有无序环,模型把「没结构」预测成了「不确定」;196-214 另有一个浅坑(67-78),置信度中等。正确写法是「无序区(pLDDT 小于 60)不参与结构解读」,而不是删掉它——低置信度本身就是生物学信号。

用什么画:AlphaFold DB 直接下载;重绘对逐残基 B-factor 列按阈值分段着色。

图注示例

图 105 FaDWF4 AlphaFold 模型的逐残基 pLDDT 曲线(模拟,239 aa)。官方配色四档:深蓝大于 90、浅蓝 70-90、黄 60-70、橙小于 60;残基 64-85 的 pLDDT 低于 60(谷底 47.9),为无序区,不参与结构解读;196-214 一段降至 67-78。

展开查看:pLDDT 数据与绘图代码

绘图代码(Python,独立可运行)

2.3 分子动力学 RMSF 柔性曲线#

RMSF 曲线

它回答什么问题:突变改变蛋白的哪些部位、柔性——第三篇 RMSD 讲「整体稳没稳」,RMSF 讲「哪里动得欢」,两个一起才是 MD 分析的完整开场。

怎么读:横轴残基,纵轴 RMSF(平均位移,埃),突变体(红)整体高于野生型(蓝,均值抬高 0.29 埃)。真正的看点是局部峰:92-106 残基的「底物通道环」在突变体里从约 2.0 埃抬到约 3.0 埃——突变不在环上却放大了环的摆动,这是「远程效应」,也是分子机制假设的来源。曲线其余部分的锯齿是正常热噪声,配阴影带(标准差)更稳。

用什么画:GROMACS 的 gmx rmsf;重绘对残基-RMSF 表画双线加阴影。

图注示例

图 106 野生型与 dwf4 突变体骨架 RMSF 对比(模拟,50 ns)。阴影为标准差带;突变体整体柔性升高(均值 +0.29 埃),底物通道环(92-106 位)差异最大(约 2.0 对 3.0 埃)。

展开查看:RMSF 数据与绘图代码

绘图代码(Python,独立可运行)

2.4 自由能 landscape 等高线图#

自由能面

它回答什么问题:蛋白构象空间里有几个稳定「盆地」、切换要翻多高的山——MD 采样的终极大图,构象切换和折叠路径全画在一张等高线图上。

怎么读:把 MD 轨迹投影到前两个主成分上,用 -kT ln P 换算成自由能(千卡/摩尔),颜色越深越稳定。两颗星是盆地:盆地 A(原生态,dG = 0)和盆地 B(dG = 2.1,亚稳态);白色箭头是盆地间的切换路径,途经的鞍点高度(约 5)就是切换代价——代价越高切换越罕见。FEL 的最大坑是采样不足:盆地边缘若还「长着」未收敛的山脊,先加模拟时长再谈结论。

用什么画:GROMACS 的 sham 或 gmx_energy;重绘对粗网格 dG 用 contourf

图注示例

图 107 100 ns 分子动力学的自由能 landscape(模拟,PC1-PC2 投影)。白色细线为等高线,标值为 dG(千卡/摩尔);两个稳定盆地:A(原生态,dG = 0)与 B(dG = 2.1),白色箭头为盆地间最低切换路径。

展开查看:网格数据与绘图代码

绘图代码(Python,独立可运行;细网格由代码按双盆地函数插值)

2.5 EMSA 凝胶迁移实验示意#

EMSA

它回答什么问题:蛋白和这段 DNA 序列在体外结不结合、结合靠不靠特异位点——启动子结合验证的老三样之一(EMSA、Y1H、ChIP-PCR),EMSA 最快也最容易被审稿人追问对照。

怎么读:泳道就是论证链。「probe」只有游离探针一条带;「+protein」出现向上迁移的滞后带(蛋白-探针复合物,跑得慢);「+50x cold」加 50 倍未标记冷探针竞争,滞后带消失——结合是序列特异的;「+mut probe」突变探针竞争不掉,滞后带仍在——突变位点正是结合位点;「+antibody」加抗体后带子跑得更慢(supershift),坐实复合物里就是这个蛋白。五条泳道缺一不可,少一条对照的 EMSA 基本会被打回。

用什么画:真实胶图用凝胶成像仪;示意图与排版用 matplotlib 画泳道条带。

图注示例

图 108 EMSA 验证 BZR1 与 DWF4 启动子 TGAAG 基序的结合(示意)。泳道依次为游离探针、加蛋白、加 50 倍冷探针竞争、加突变探针、加抗体;滞后带可被冷探针竞争消除、被抗体进一步超迁移。

展开查看:绘图代码(示意条带)

2.6 亚细胞定位示意图#

亚细胞定位

它回答什么问题:蛋白在细胞里待在哪个区室——基因功能论文的最后一格拼图,GFP 融合表达加共聚焦拍照,画成示意图比贴原始照片更能讲清定位模式。

怎么读:左右两个细胞是论证的对照组与实验组:左边 35S::GFP 空对照,荧光弥散全细胞(细胞质+细胞核都亮)——证明 GFP 本身不定位;右边 DWF4p::GFP,信号集中在细胞边缘的质膜(粗绿轮廓)加细胞核(实心椭圆)。两图并排、同一标尺(20 um),结论就是「DWF4 定位于质膜与细胞核」。注意审稿人常问质膜信号是不是内质网的假象,正文要补一个质壁分离或共定位 marker 的验证。

用什么画:共聚焦原始图为主图,示意图用 Illustrator;matplotlib 的椭圆+轮廓也能画个七成像。

图注示例

图 109 烟草瞬时表达体系的亚细胞定位(示意)。左:35S::GFP 对照,荧光弥散于细胞质与细胞核;右:DWF4p::GFP,信号定位于质膜与细胞核。比例尺 20 um。

展开查看:绘图代码(示意)

三、生化与湿实验曲线#

3.1 Lineweaver-Burk 双倒数图#

双倒数图

它回答什么问题:抑制剂是竞争性还是非竞争性的——把米氏方程(第二篇图 64 的双曲线)取双倒数拉直,抑制剂的类型就从「看形状猜」变成「看直线族怎么动」。

怎么读:横轴 1/[S]、纵轴 1/v,三条直线对应三种处理。判读口诀记直线怎么动:竞争性抑制剂与底物抢活性中心,加大底物能救回来——纵轴截距(1/Vmax)几乎不变(61 对 62)、横轴截距左移(-1/Km 从 -1.27 移到 -0.40),直线族近似在纵轴交汇;非竞争性 Vmax 掉到 27、Km 同时缩到 0.36,三条线各走各的。数据点只在高底物浓度处偏离直线是正常的(双倒数放大低浓度误差),拟合前先看原始双曲线。

用什么画:GraphPad 的 enzyme kinetics 模块;重绘对双倒数数据线性拟合。

图注示例

图 110 三种条件下酶促反应的 Lineweaver-Burk 图(模拟,图例为米氏方程非线性拟合值)。无抑制剂 Vmax = 61、Km = 0.79 mM;竞争性抑制剂使 Km 增至 2.47 mM 而 Vmax 不变(62),直线族近似纵轴交汇;非竞争性抑制剂使 Vmax 降至 27、Km 缩至 0.36 mM。

展开查看:动力学数据与绘图代码
substrate_mM,v_no_inhibitor,v_competitive,v_uncompetitive
0.1,6.5,2.9,5.4
0.2,12.7,3.5,9.2
0.5,23.9,10.8,15.9
1.0,33.4,17.3,20.0
2.0,44.9,27.7,22.8
5.0,53.4,42.1,24.5
10.0,56.8,48.6,25.7
20.0,58.5,55.1,26.7
csv

绘图代码(Python,独立可运行)

3.2 DSF 差示扫描荧光熔解曲线#

DSF 曲线

它回答什么问题:配体结合让蛋白更稳定了吗——热位移实验(DSF/Thermal shift)的产出就是一条熔解曲线加一个 dTm,是低成本筛选结合条件的首选。

怎么读:横轴升温程序(25-95 C),纵轴染料荧光(蛋白变性展开后疏水区暴露、染料变亮)。曲线的拐点就是熔解温度 Tm:载脂蛋白 52.4 C,加 brassinolide 后 58.1 C——dTm = +5.7 C,说明配体结合把蛋白「钉」得更稳。判读标准:dTm 大于 2 C 才算明确结合信号;正位移(变稳)与负位移(变松)都有意义,重复孔的 Tm 标准差应小于 0.5 C。

用什么画:定量 PCR 仪或 NanoDSF 自带软件;重绘对 RFU-温度表画双曲线加 Tm 竖线。

图注示例

图 111 DSF 热位移实验检测 brassinolide 与 FaDWF4 的结合(模拟)。曲线为 SYPRO 荧光随升温的变化,Tm 由拐点读出:载脂 52.4 C、加配体 58.1 C,dTm = +5.7 C。

展开查看:RFU 数据与绘图代码

绘图代码(Python,独立可运行)

3.3 ELISA 标准曲线与回算#

ELISA 曲线

它回答什么问题:激素定量最后那个数字是怎么来的——标准品的四参数 logistic(4PL)曲线是所有免疫定量的地基,未知样品的浓度是沿着曲线「查」回去的。

怎么读:蓝点是 8 个标准品(浓度取对数轴),红线是 4PL 拟合;未知样品(红点)测得 OD 后沿水平线找到曲线、再垂直落回横轴读浓度(虚线路径):S1 = 0.42、S2 = 1.22、S3 = 2.61 ng/mL。回算的三条纪律:未知样品 OD 必须落在标准曲线的线性区间内(S3 靠近上平台,重复测定要稀释重做);每个点做复孔报 CV;曲线参数(底、顶、IC50、斜率)要写进方法,不能只贴一条线。

用什么画:GraphPad、SoftMax;重绘 scipy.optimize.curve_fit 拟合 4PL 后按虚线路径标注。

图注示例

图 112 GA3 竞争法 ELISA 的标准曲线与样品回算(模拟)。蓝点为 8 个标准品,红线为 4PL 拟合;三个未知样品沿虚线路径回算,S1 = 0.42、S2 = 1.22、S3 = 2.61 ng/mL。

展开查看:标准品数据与绘图代码
standard_ng,od
0.000,0.067
0.078,0.112
0.156,0.201
0.312,0.339
0.625,0.562
1.250,0.859
2.500,1.230
5.000,1.529
csv

绘图代码(Python,独立可运行;未知样品 OD 见图内标注)

3.4 荧光发射光谱位移图#

荧光位移

它回答什么问题:配体滴进去,蛋白真的动了吗——内源荧光(色氨酸)的峰移与淬灭是结合证据链里最便宜的一环,常与 DSF、ITC 并排出现。

怎么读:横轴发射波长(激发固定 280 nm),四条曲线是配体浓度梯度。读两个同时发生的现象:峰高被压(荧光淬灭,1.0 降到 0.45)和峰位红移(342 nm 移到 356 nm,色氨酸环境变疏水/构象收紧)。两者随配体浓度渐进且饱和,即可拟合结合常数 Kd;只有强度变化没有峰移,也可能是碰撞淬灭,需加lifetime实验区分。

用什么画:荧光分光光度计自带;重绘按波长-强度宽表画多线。

图注示例

图 113 配体滴定下 FaDWF4 内源荧光的发射光谱(模拟,ex = 280 nm)。配体 0-20 uM 梯度下发射峰由 342 nm 红移至 356 nm,强度淬灭至 45%,呈可饱和结合特征。

展开查看:光谱数据与绘图代码

绘图代码(Python,独立可运行)

3.5 双荧光素酶报告柱状图#

双荧光素酶

它回答什么问题:转录因子是不是真的激活了这个启动子、靠不靠那个位点——双荧光素酶(LUC/REN)是启动子-转录因子互作验证的顶梁柱,论证结构全在五根柱子里。

怎么读:纵轴是 LUC/REN 归一化比值(REN 内参先扣掉转化效率差异)。读论证链:promoter-WT 单独有基础活性(2.9);加 BZR1 效应子冲到 7.4(***,激活);换成 site-mutated 启动子后基础活性掉回 1.1、加 BZR1 也只有 1.3——位点突变既杀基础活性又杀诱导,证明该基序是响应必需。对照的完整度(空载体归一化、突变对照、无效应子对照)决定这张图的说服力。

用什么画:Promega Dual-Luciferase 仪出原始读数,作图就是带误差线的柱状图加显著性标记。

图注示例

图 114 双荧光素酶验证 BZR1 对 DWF4 启动子的激活(模拟)。柱高为 LUC/REN 比值(均值 ± 标准差,n = 6);野生型启动子被 BZR1 激活 2.6 倍(***,p < 0.001),基序突变后激活消失。

展开查看:数据与绘图代码
construct,ratio,sd
empty vector,1.00,0.12
promoter-WT,2.90,0.31
promoter-WT + BZR1,7.40,0.62
promoter-mut,1.10,0.14
promoter-mut + BZR1,1.30,0.18
csv

绘图代码(Python,独立可运行)

## 四、微生物与生态

4.1 稀疏化曲线#

稀疏化曲线

它回答什么问题:每个样本的测序量够不够、多样性还能不能再挖出来——alpha 多样性比较前必须先过这一关,否则「物种多」可能只是「测得多」。

怎么读:横轴抽样 reads 数,纵轴在该深度下重复抽样能观测到的 ASV 数。三条曲线前段陡(新 reads 不断带来新物种)、后段缓(物种池接近抽干)。本例 site A 到 4 万 reads 仍有爬升(83 附近还在涨,图内标注「未饱和、值得加测」),site B 在 52-54 波动、site C 在 30 上下已平台。判读口诀:比较多样性的样本必须都落在平台区;没平台的样本要么加测,要么稀释到共同深度再算。

用什么画:QIIME2 的 qiime diversity alpha-rarefaction、R vegan 的 rarecurve;重绘按深度-ASV 表画多线。

图注示例

图 115 三个根际土壤样点的稀疏化曲线(模拟)。横轴为抽样 reads 数,纵轴为观测 ASV 数;site A 至 40,000 reads 仍未完全饱和(83.7 且持续上升),site B(54.0 附近)与 site C(约 30)已进入平台。

展开查看:稀疏化数据与绘图代码

绘图代码(Python,独立可运行)

4.2 rank-abundance 曲线#

rank-abundance 曲线

它回答什么问题:群落的优势度结构——是少数物种说了算,还是雨露均沾。稀疏化回答「够不够」,这张回答「匀不匀」,一对好搭子。

怎么读:横轴把物种按丰度从高到低排的秩,纵轴相对丰度(常取对数)。曲线的起点高度是最强优势种的分量:treatment A 首位物种占 61.7%,C 只有 24.3%;曲线的下降陡度是均匀度:A 掉得快(高优势模式),C 平缓拖出长尾(均匀模式)。生态学上对应的指数就是 Simpson/Shannon——这张图是它们的「形状版」,一张图同时看到优势度和丰富度。

用什么画:R vegan 的 radfit;重绘对秩-丰度表画多线。

图注示例

图 116 三种处理下根际细菌的 rank-abundance 曲线(模拟,各取前 25 个 ASV)。处理 A 首位优势种占 61.7% 且曲线陡降,为高优势度结构;处理 C 首位仅 24.3%、长尾平缓,群落更均匀。

展开查看:秩-丰度数据与绘图代码

绘图代码(Python,独立可运行)

4.3 三元相图#

三元相图

它回答什么问题:每个样本在三个区室(土体、根际、根内)之间的组成比例——植物微生物组研究「梯度假说」的标准图:从土到根,一路过滤出特定类群。

怎么读:三角形三个顶点各代表 100% 属于某一区室端(顶=根内 endophyte、左下=土体 bulk soil、右下=根际 rhizosphere),点在三角形内的位置就是三个比例的合成。本例土体样 B1-B6 挤向左下角(bulk 占 0.60-0.78),根际样 R1-R6 落在右下-中部带(rhizo 0.43-0.68),根内样 E1-E6 拉向顶点(endo 0.56-0.87,其中 E3 高达 0.87)——梯度清晰。特别注意「跨界」的点:R5(0.23/0.43/0.34)根内比例偏高,值得单独看它的物种组成是不是混入了根内优势菌。

用什么画:R 的 Ternary 包、Python 的 python-ternary;重绘把三元坐标线性变换到二维再散点。

图注示例

图 117 根-土连续体 18 个样本群落组成的三元相图(模拟)。顶点分别为根内(上)、土体(左下)、根际(右下);土体、根际、根内样本各自聚向对应顶点,梯度清晰;R5 的根内比例(34%)高于根际组其余样本。

展开查看:组成数据与绘图代码

绘图代码(Python,独立可运行)

4.4 RDA 排序图#

RDA 排序图

它回答什么问题:哪些环境因子在塑造群落组成——把样方和因子箭头画进同一坐标系,「谁跟谁走」一眼可读,是土壤/微生物组论文出场率最高的排序图。

怎么读:点是一个样方,箭头是一个环境因子,箭头越长该因子解释力越强,两箭头夹角近似其相关性。读法一句话:样方落在某箭头的延长线方向上,该因子的值就高。本例土体组(B,左侧)沿 pH 正方向,根际组(R,右上)沿 total N 箭头(1.85, 0.25),根内组(E,右下)在 moisture 负端——三个区室各被不同因子「拉住」。正式分析要报约束轴的解释率与 permutation 检验 p 值,图里至少标注 RDA1/RDA2 的解释百分比。

用什么画:R vegan 的 rda + envfit;重绘对样方坐标与因子箭头坐标分面板散点加箭头。

图注示例

图 118 根-土连续体 18 个样本的 RDA 排序图(模拟)。点为样方(按区室着色),箭头为环境因子:土体组与 pH 同向,根际组沿 total N 方向(箭头终点 1.85, 0.25),根内组位于 moisture 负端。

展开查看:样方与因子数据、绘图代码
variable,rda1,rda2
total N,1.85,0.25
pH,-1.25,1.05
moisture,0.35,-1.75
SOM,1.15,-0.70
csv

绘图代码(Python,独立可运行)

4.5 LEfSe 分支图(cladogram)#

LEfSe 分支图

它回答什么问题:两组微生物组的差异集中在分类树的哪些枝条上——不是「哪些物种差异」(那是火山图/柱状图的事),而是「差异有没有分类学上的系统性」。

怎么读:同心圆从内到外是 门 → 纲 → 属,每个扇形一个分类单元,颜色标注它在哪一组显著富集,半径对应相对丰度。本例四根红色枝条(Actinomycetes、Coriobacteriia、Alpha- 与 Gammaproteobacteria 四个纲)及其下属 8 个属全部富集于矮化组,野生型组没有独立富集的枝,灰色为不显著——「矮化伴随一支放线菌的系统性扩张」这样的结论才立得住。正式版要配 LDA 评分柱状图(通常 LDA > 2 才画进 cladogram)。

用什么画:LEfSe 原流程(Huttenhower 实验室)或在线版 microbiomeanalysis;重绘按 分类单元-层级-分组 表用楔形块拼。

图注示例

图 119 矮化与野生型植株根际菌群差异的 LEfSe 分支图(模拟)。环层由内向外为门、纲、属;红色为矮化组显著富集(Actinomycetes、Coriobacteriia、Alphaproteobacteria、Gammaproteobacteria 及其下属属),灰色为不显著;本例野生型侧无独立富集枝。

展开查看:分类层级数据与绘图代码

绘图代码(Python,独立可运行;核心是把每个分类单元放到所属父类的扇区里)

4.6 时间杀菌曲线#

时间杀菌曲线

它回答什么问题:抗生素在 24 小时里把菌压到哪、会不会反弹——药敏试验里 MIC 只给一个终点的量,time-kill 给全过程形状,直接指导给药频次。

怎么读:横轴时间,纵轴 log10 CFU/mL。三条线三种故事:4× MIC 两小时压降 1.7 个对数(6.41→4.70),24 h 到 1.99、贴着检测限(灰色虚线附近);1× MIC 前段有效(6 h 最低 4.65)但随后回升(24 h 回到 6.25)——初压不住后的 regrowth,提示浓度不足或耐受亚群被筛出;对照平稳(6.3-6.4)。形状判读口诀:持续下坠是浓度依赖,早降后平是时间依赖,回弹是耐药信号。

用什么画:GraphPad 生长曲线模板;重绘按 时间-分组 表画多线加检测限横线。

图注示例

图 120 铜绿假单胞菌分离株的时间杀菌曲线(模拟)。0-24 h 每 2-6 h 计数一次;4× MIC 组 2 h 内降 1.7 log10(6.41→4.70)、24 h 达 1.99 log10 CFU/mL(检测限附近);1× MIC 组 6 h 后回弹至 6.25,提示再生。

展开查看:计数数据与绘图代码
time_h,control,abx_1x,abx_4x
0,6.41,6.30,6.41
2,6.35,5.59,4.70
4,6.37,4.94,3.24
6,6.36,4.65,2.53
8,6.33,4.80,2.32
12,6.33,5.50,2.11
18,6.33,6.07,2.19
24,6.41,6.25,1.99
csv

绘图代码(Python,独立可运行)

五、代谢组与宏基因组#

5.1 镜像质谱图#

镜像质谱图

它回答什么问题:这个质谱峰到底是不是注释表里那个分子——把样品谱图和数据库标准谱图上下镜像叠起来,匹配质量一眼可见,是代谢组注释审核的最后一道关。

怎么读:上方向为样品谱(query),下方向为库谱(reference),横轴 m/z。峰对得越齐,匹配越可信——图内标注余弦相似度 0.93(GNPS 常用 0.7 作阈值)。重点看「不对称」的峰:m/z 135 处库里有强峰(22)而样品缺失(标 unmatched),提示它可能是加合离子或共洗脱碎片,不参与打分;反过来样品独有的峰则要去查同位素/加合物。谱图对不齐但相似度高的,往往是无关分子「撞分」,镜像一摆就露馅。

用什么画:GNPS 的 spectral library match 页面直接出镜像图;重绘对 m/z-强度双列画上下镜像杆图。

图注示例

图 121 未知代谢物与数据库标准品的 MS/MS 镜像比对(模拟)。上方为样品谱、下方为库谱,余弦相似度 0.93;m/z 135 仅存在于库谱(unmatched),判为加合离子相关峰。

展开查看:谱峰数据与绘图代码
mz,sample_intensity,library_intensity
74,40,38
88,100,96
120,65,70
135,0,22
163,30,28
205,55,52
250,18,15
csv

绘图代码(Python,独立可运行)

5.2 Van Krevelen 图#

Van Krevelen 图

它回答什么问题:几百个 DOM/代谢物分子各自属于哪个化学家族——只用两个原子比(H/C、O/C)就把元素组成翻译成化学语义,傅里叶变换离子回旋共振质谱(FT-ICR MS)论文的标配。

怎么读:横轴 H/C、纵轴 O/C,每个点一个分子式,图上按经验区域划分 lipid、protein、carbohydrate、lignin、tannin 等分区。本例脂类聚在右下(H/C 1.6-1.8、O/C 小于 0.2),糖类在高氧区(O/C 0.8-1.0),木质素-单宁偏左上(低 H/C 高 O/C 的芳香区)——木质素与单宁点占比高,说明这批溶解性有机质以难降解芳香结构为主。判读口诀:点沿脱氧方向移动=还原过程,向高 O/C 移动=氧化过程,处理前后分区占比的变化就是「化学故事线」。

用什么画:R 的 FTMSPlotting、Python 手写分区背景;重绘按 H/C-O/C-分类表散点加分区底色。

图注示例

图 122 40 个 DOM 化合物的 Van Krevelen 图(模拟)。横轴 H/C、纵轴 O/C,底色区为经验分类区;脂类(H/C 1.6-1.8,O/C ≤ 0.21)、糖类(O/C 0.79-0.97)与木质素-单宁芳香区(H/C ≤ 1.31 且 O/C 0.12-0.74)各有聚集。

展开查看:元素比数据与绘图代码

绘图代码(Python,独立可运行)

5.3 Blob 图(bin 质控散点)#

Blob 图

它回答什么问题:宏基因组组装出的每个 bin 是「谁」、干净不干净——GC 含量、覆盖度、分类三重证据叠在一张图上,bin 提纯(rectification)前的必看图。

怎么读:横轴 GC%、纵轴覆盖度,点大小与 bin 长度成正比,颜色是分类学归属。同一基因组应聚成 GC/覆盖度一致的「云」:bin7(Eukarya,39% GC、52×、31.6 Mb 的大泡泡)自成一团没问题;但要警惕「一色多点散开」——若同一分类的点覆盖度差好几倍,多半混了多个物种或菌株。右下角的 undefined 小碎片(bin11,35% GC、9×、0.6 Mb)通常是低质量 bin,先查 completeness/contamination 再决定并入还是丢弃;GC 极端(62%)又小的 bin12 要防污染。

用什么画:BlobToolKit 一条命令出全套;重绘按 bin-分类-GC-覆盖度-长度表画气泡图。

图注示例

图 123 12 个宏基因组组装 bin 的 Blob 图(模拟)。横轴 GC%、纵轴覆盖度,气泡面积与 bin 长度成正比;bin7(Eukarya)以 31.6 Mb、52× 覆盖度独立成团,bin11(undefined,0.6 Mb)与 bin12(60% GC)需进一步质控。

展开查看:bin 数据与绘图代码
bin,taxonomy,gc,coverage,length_mb
bin1,Bacteria,51,32,18.4
bin2,Bacteria,44,21,9.2
bin3,Bacteria,58,45,3.1
bin4,Bacteria,47,15,2.4
bin5,Archaea,41,27,2.8
bin6,Archaea,45,38,1.9
bin7,Eukarya,39,52,31.6
bin8,Eukarya,43,33,8.8
bin9,Eukarya,55,12,1.5
bin10,undefined,62,24,0.9
bin11,undefined,35,9,0.6
bin12,Bacteria,60,18,1.2
csv

绘图代码(Python,独立可运行)

六、AI 与多组学前沿#

6.1 MOFA 因子图#

MOFA 因子图

它回答什么问题:转录组、蛋白组、代谢组一起测时,各组学共享的「变化主线」是什么——MOFA 把三套数据压进少数几个因子,多组学整合从「三张图各说各话」变成一张图。

怎么读:左面板是样本在前两个因子上的散点(按基因型着色):Factor1 把三组排成一条直线(brz 在 -3.3 到 -1.9,WT 居中,GA3 在 +1.6 到 +3.2)——这是处理效应的「总轴」;Factor2 上 WT7 独自上飘(0.55),值得查批次。右面板是每个因子在各组学里的解释方差 R2:Factor1 主要由 mRNA(46%)和蛋白组(30%)驱动,Factor2 则代谢组贡献最大(31%)——哪个组学主导哪个生物学过程,一目了然。判读纪律:因子要回头去看载荷(哪些基因/代谢物压在因子上),不能停在「分开了」。

用什么画:MOFA2(R/Python)官方 pipeline;重绘按 样本-因子 坐标与 组学-R2 表拼双面板。

图注示例

图 124 24 个样本转录组-蛋白组-代谢组的 MOFA 因子分析(模拟)。左:Factor1-Factor2 散点,Factor1 沿 brz-WT-GA3 排列;右:各因子逐组学解释方差,Factor1 由 mRNA(46%)与蛋白组(30%)主导,Factor2 以代谢组最高(31%)。

展开查看:因子坐标与 R2 数据、绘图代码
view,factor1_r2,factor2_r2,factor3_r2
mRNA,46,21,9
proteome,30,12,22
metabolite,14,31,6
csv

绘图代码(Python,独立可运行)

6.2 深度学习归因轨迹图#

归因轨迹图

它回答什么问题:模型预测启动子强度时,到底在「看」哪些碱基——把逐碱基归因分数画成轨迹,深度学习模型从黑箱变成可核对的假设生成器。

怎么读:横轴启动子位置(60 bp),每根柱是一个碱基(按 A/C/G/T 着色),柱高为归因分数。两个高归因区跳出来:19-23 位的 TGAAG(0.58-0.87)和 43-48 位的 GTTGAC(0.44-0.75),与 EMSA 验证的 BZR1 结合基序对上了——模型「看重」的位置和湿实验「验证」的位点咬合,这是 AI 结果可信的最强证据形式。判读纪律:归因高≠因果,要 shuffle 对照(打乱序列后归因应消失);多个高归因区但都不匹配已知 motif 时,先怀疑模型学了背景特征(GC 含量、poly-A)。

用什么画: saliency/integrated gradients 出原始分数,TF-MoDISco 聚成 motif;重绘按 位置-碱基-归因 表画彩色柱状。

图注示例

图 125 启动子强度模型的逐碱基归因轨迹(模拟,60 bp)。柱高为归因分数、颜色为碱基;19-23 位 TGAAG(峰值 0.87)与 43-48 位 GTTGAC(0.75)两个高归因区,与 EMSA 验证的 BZR1 结合基序一致。

展开查看:归因数据与绘图代码

绘图代码(Python,独立可运行)

6.3 蛋白语言模型嵌入 UMAP#

蛋白嵌入 UMAP

它回答什么问题:不用比对,只靠序列「语感」,蛋白能不能按家族分开——ESM 这类蛋白语言模型把每条序列变成向量后降维,是大规模功能注释的当红路线。

怎么读:每个点一条蛋白(此处每家族 10 条),颜色是已知家族标签。四个已知家族各自聚团、团间零重叠,说明嵌入空间里「序列相似=功能相近」成立;中央的 DUF(未知功能域)团不与任何家族融合——它是个真实的未知家族,语言模型给出的最近邻家族就是注释候选。判读纪律:UMAP 的距离没有全局意义,只看「团与团的关系」;团若散碎,先查序列长度分布是不是被嵌入长度偏置带偏了。

用什么画:ESM-2/ProtTrans 出嵌入,UMAP 降维;重绘对 嵌入坐标-家族 表散点并标质心。

图注示例

图 126 50 条蛋白的 ESM 嵌入 UMAP 投影(模拟)。每家族 10 条:kinase、bHLH、P450、LRR 各自聚团,中心 DUF 家族(绿色)与已知家族均不重叠,为候选新家族。

展开查看:嵌入坐标与绘图代码

绘图代码(Python,独立可运行)

6.4 泛基因组组装图(graph 视图)#

泛基因组图

它回答什么问题:单线性参考会漏掉的样本间结构变异长什么样——泛基因组把「一个参考」换成「一张图」,图视图(Bandage 风格)是检查组装图质量的肉眼关卡。

怎么读:每个节点一段序列(标注长度),边是相邻关系;样本的基因组=图里的一条路径。三个看点:core 节点(深色,所有样本都走)构成主干;**泡(bubble)**是等位/结构分歧——C 与 D 组成泡,样本 1 走 C(20 kb)、样本 2 走 D(14 kb);repeat 节点(R,14 kb,三条入射边)是多拷贝重复,也是长读长比对歧义的高发地。 accessory 节点(浅色)只在部分样本出现——泛基因组分析的核心产出就是统计「哪些 accessory 路径与表型共分离」。

用什么画:pggb 构建图、Bandage 可视化;重绘按 节点表+边表 用圆角方块加连线。

图注示例

图 127 五样本泛基因组组装图的示意视图(模拟)。节点为序列段(标注长度,kb),core/accessory/repeat 三类着色;C-D 节点对构成样本间变异泡,repeat 节点 R 有三条入射边。

展开查看:节点与边数据、绘图代码
node,length_kb,class
A,24,core
B,16,core
C,20,accessory
D,14,accessory
E,30,core
R,14,repeat
F,18,accessory
G,22,core
csv
node1,node2
A,B
B,C
B,D
C,E
D,E
E,R
R,F
R,G
F,G
A,G
csv

绘图代码(Python,独立可运行)

6.5 跨组学 UMAP 三联图#

跨组学 UMAP

它回答什么问题:三个组学各自降维后,结论互相印证吗——比 MOFA 少了统计建模,但更直观:同一样本集在三个空间里的「形状」应该讲同一个故事。

怎么读:三个面板是同一批 24 个样本在 mRNA、蛋白组、代谢组各自 UMAP 空间里的位置,颜色统一按基因型。健康的整合:三张图里组间分离方向一致(brz 一侧、GA3 另一侧、WT 居中),且同一样本的三个影子相对位置不打架。本例三联全部按基因型分离——结论跨组学稳健;若某个组学面板里混作一团,先查它的批次效应与标准化,而不是急着下「该组学无差异」的结论。注意 UMAP 坐标跨面板不可比,比较的只是「分组结构」。

用什么画:totalVI/MOFA 输出或各组学分别跑 UMAP 后拼图;重绘对 宽表(样本-基因型-三对 UMAP 坐标)画三联小倍数。

图注示例

图 128 同一批 24 个样本在转录组、蛋白组、代谢组三个 UMAP 空间中的投影(模拟,三联小倍数)。三个组学面板中样本均按基因型分离且方向一致,结论跨组学稳健。

展开查看:坐标数据与绘图代码

绘图代码(Python,独立可运行)

七、统计与呈现杂图#

7.1 漏斗图#

漏斗图

它回答什么问题:把十几个研究合成一个结论的 meta 分析,有没有被「只发表阳性结果」带偏——漏斗图是发表偏倚的体检表。

怎么读:横轴各研究的效应量,纵轴标准误(研究越弱越靠下),中竖线是合并效应(0.42),两侧斜线围出 95% 置信「漏斗」。理想状态:点关于竖线对称,小研究均匀散在漏斗两翼。本例 12 项研究整体围绕 0.42,但右翼漏出 S7(0.67、se 0.106)一类「小样本+高效应」的研究,右移明显——先做 Egger 回归检验,显著就跑剪补法(trim-and-fill)看合并效应会不会缩水。漏斗对称性差不是「删掉证据」,而是「降结论强度」的信号。

用什么画:R metafor 的 funnel();重绘对 研究-效应-标准误 表散点加合并线与伪置信带。

图注示例

图 129 12 项研究效应量的漏斗图(模拟)。横轴效应量、纵轴标准误,中竖线为合并效应 0.42;右翼小样本研究(如 S7,0.67)整体右移,提示潜在发表偏倚。

展开查看:研究数据与绘图代码
study,effect,se
S1,0.32,0.035
S2,0.20,0.047
S3,0.34,0.059
S4,0.30,0.070
S5,0.08,0.082
S6,0.14,0.094
S7,0.67,0.106
S8,0.16,0.118
S9,0.28,0.130
S10,0.25,0.141
S11,0.17,0.153
S12,0.17,0.165
csv

绘图代码(Python,独立可运行)

7.2 哑铃图#

哑铃图

它回答什么问题:同一通路在两个时点间的 NES 变化方向与幅度——两次独立条形图各自看是「都变了」,哑铃一连才知道「往哪边变」。

怎么读:每行一条通路,两端圆点是 12 h 与 48 h 的标准化富集分数(NES),连线即变化轨迹,48 h 数值标在点旁。三种形状三种结论:BR signaling 从 1.8 拉长到 2.6(持续增强)、photosynthesis 从 -1.4 深到 -2.2(抑制加深)、nitrate transport 从 -1.1 收回到 -0.4(早期抑制回调)——「早期下调、后期恢复」的适应型通路只有哑铃能一眼看出来。排序建议按 48 h 值排,读图者扫一眼就能抓最两端。

用什么画:R 的 ggalt geom_dumbbell;重绘对 通路-两时点 表画横线加双点。

图注示例

图 130 缺水处理后 12 h 与 48 h 两个时点的通路 NES 哑铃图(模拟)。蓝点 12 h、红点 48 h(数值标注);BR signaling 由 1.8 增至 2.6,photosynthesis 由 -1.4 深至 -2.2,nitrate transport 由 -1.1 回调至 -0.4。

展开查看:NES 数据与绘图代码
pathway,nes_12h,nes_48h
BR signaling,1.8,2.6
flavonoid biosynthesis,1.2,2.4
cell wall loosening,0.9,2.1
photosynthesis,-1.4,-2.2
starch degradation,-0.6,-1.7
ABA signaling,0.4,1.3
nitrate transport,-1.1,-0.4
protein synthesis,-1.9,-2.6
csv

绘图代码(Python,独立可运行)

7.3 瀑布图#

瀑布图

它回答什么问题:20 个基因型对处理的响应分布全貌——均值会埋掉极端材料,瀑布图把每一个体排成阶梯,育种里挑极端材料的「选种图」。

怎么读:横轴是按响应率排序的基因型,纵轴是产量变化百分比,绿升红降(按符号着色),中位线标注群体典型响应(+3.0%)。两端即信息:G1(+24.4%)与 G2(+13.2%)是候选耐旱材料,G20(-18.9%)、G19(-13.8%)是敏感材料;中段密密麻麻的「平庸带」提醒你效应主要靠两端少数基因型拉动。判读纪律:先确认响应率的分母(对照是哪一年的、重复几次),瀑布图最怕单点极端值其实是测量误差。

用什么画:肿瘤学术圈的标准图(R 的 waterfalls 包),农业里同样好用;重绘按 基因型-变化率 表排序柱状并按符号着色。

图注示例

图 131 20 个基因型干旱处理下的产量变化瀑布图(模拟)。按变化率降序排列,绿色为正响应、红色为负响应;中位数 +3.0%,两端 G1(+24.4%)与 G20(-18.9%)为极端材料。

展开查看:响应数据与绘图代码

绘图代码(Python,独立可运行)

7.4 帕累托图#

帕累托图

它回答什么问题:测序 QC 失败原因里,哪两三类占了八成——把频次柱状图和累计百分比折线叠起来,资源该往哪投一目了然。

怎么读:柱子按频次降序(index hopping 42、adapter dimer 31、low Q30 18……),右轴折线是累计占比:前两类合计 55%,前三类 68%——抓头三类就能消掉七成问题,剩下的长尾(poly-G、other 各 2-3 例)不值得单独立项。帕累托图的读法就一句:折线越过 80% 的位置之前的所有柱子才是「主要矛盾」。柱顶直接标频次数值,省得读者来回对轴。

用什么画:Excel/Pareto 图表类型一步出;重绘双 y 轴(左频次、右累计百分比)。

图注示例

图 132 一个季度测序 QC 失败原因的帕累托图(模拟,共 133 例)。柱为各类频次(降序,柱顶标注),折线为累计占比:index hopping 与 adapter dimer 合计 55%,前三类累计 68%。

展开查看:频次数据与绘图代码
category,count
index hopping,42
adapter dimer,31
low Q30,18
duplication,12
GC bias,9
chimera,7
N-heavy reads,5
short insert,4
poly-G tail,3
other,2
csv

绘图代码(Python,独立可运行)

7.5 三维 PCA#

3D PCA

它回答什么问题:二维 PCA 看不出分组时,第三主成分里有没有藏着信息——也是本系列唯一一张「先想想再画」的图:3D 好看,但常不如两张 2D 投影诚实。

怎么读:30 个代谢组样本投到 PC1-PC3 空间(视角 elev 22、azim 118,标注在代码里,固定视角才可复现)。三组分离清晰:WT 占 PC1 正端,brz 与 GA3 沿 PC2 分开,PC3 贡献的是组内散布。判读纪律:3D 图必有遮挡与透视失真,发表时配 1-2 张 2D 投影作「诚实版」;交互式旋转图(plotly HTML)是更好的补充;「PC 轴解释百分比」照旧标进轴标签。

用什么画:sklearn PCA 出分后 matplotlib 的 projection="3d" 或 plotly 交互图;重绘对 样本-基因型-PC1/2/3 表三维散点。

图注示例

图 133 30 个代谢组样本(三基因型各 10 个)的 3D PCA(模拟)。三组沿 PC1-PC2 分离,视角 elev = 22、azim = 118;3D 透视仅作补充,结论以 2D 投影为准。

展开查看:坐标数据与绘图代码

绘图代码(Python,独立可运行)

八、写在最后:此篇收束,系列续于第五篇#

前四篇合计 133 张图第一篇 41 张打底(统计、转录组、临床)、第二篇 33 张进阶(群体遗传、比较基因组、单细胞)、第三篇 29 张承接(测序 QC、表观、空间组学)、本篇 30 张(蛋白、生化、生态、AI 多组学)。系列未完——第五篇(40 张,蛋白结构、变异与表达验证)首次成建制引入真实 PDB/AlphaFold 坐标与 4 张浏览器可拖拽的交互 3D,第六篇(22 张,真实公开数据实战)再用 1001 Genomes 全基因组矩阵把全套推到 195 张。写完这轮最大的体会还是那句朴素的话:先想清楚这张图要回答的那句话,再挑图型;反过来就会画出漂亮但没用的图。133 张里没有一张是因为「好看」被选进来的——它们各自回答一个具体问题,图注里的每一个数字都与生成它的数据严格一致,折叠块里的 CSV 和代码让你从这张网页直接复现到自己的终端。

再往前走,有两件事值得做:一是把这批模拟图换成你自己的真实数据(每张图的代码都只吃一张 CSV,替换路径就能跑);二是把重复劳动交给工具——Linxira Bio SDK(我主导开发的本地优先生信工具链)正在把「跑分析、出表、到画图前的最后一公里」版本化,实际可用能力以正式分支最新 release 为准。哪张图你想要「真实数据版」「交互版」或者补一个我没覆盖的图型,评论区点单。

参考文献#

  1. Michaelis L, Menten ML (1913). Die Kinetik der Invertinwirkung. Biochem Z 49:333-369. — 米氏方程原始论文(图 110 的上游)。
  2. Lineweaver H, Burk D (1934). The determination of enzyme dissociation constants. J Am Chem Soc 56:658-666. — 双倒数作图法。
  3. Jumper J et al. (2021). Highly accurate protein structure prediction with AlphaFold. Nature 596:583-589. — pLDDT 置信度的出处(图 105)。
  4. Lin Z et al. (2023). Evolutionary-scale prediction of atomic-level protein structure with a language model. Science 379:1123-1130. — ESM 蛋白语言模型(图 126)。
  5. Wang M et al. (2016). Sharing and community curation of mass spectrometry data with GNPS. Nat Biotechnol 34:828-837. — 分子网络与镜像谱图比对(图 121)。
  6. Caporaso JG et al. (2010). QIIME allows analysis of high-throughput community sequencing data. ISME J 4:664-672. — 稀疏化等多样性分析流程(图 115)。
  7. Segata N et al. (2011). Metagenomic biomarker discovery and explanation. Genome Biology 12:R60. — LEfSe(图 119)。
  8. Argelaguet R et al. (2018). Multi-Omics Factor Analysis—a framework for unsupervised integration of multi-omics data sets. Mol Syst Biol 14:e8124. — MOFA(图 124)。
  9. Shrikumar A et al. (2018). Technical note: Transcription factor motif discovery from attribution scores (TF-MoDISco). — 深度学习归因聚 motif(图 125)。

参考代码#

  • 第四篇 30 张图的全部生成脚本:仓库 tools/bio-plots/ch10c_more.py(104-120)与 ch10d_more.py(121-133),随机种子固定,重跑即可复现文中每一根线条。
  • Linxira Bio SDK:本地优先的生信执行工具链(官网);架构思路见我的拆解文
  • 系列前三篇:第一篇 · 第二篇 · 第三篇

原文存档:本文初版发布于旧站(Butterfly 主题)。如遇图表、代码高亮或 3D 交互显示异常,请查阅 完整存档版

生信图表大全(第四篇):从蛋白互作到 AI 多组学的 30 张图
https://bohuyeshan.top/2026/09/12/2026-09-12-04-%E7%94%9F%E4%BF%A1%E5%9B%BE%E8%A1%A8%E5%A4%A7%E5%85%A8%E7%AC%AC%E5%9B%9B%E7%AF%87-%E4%BB%8E%E8%9B%8B%E7%99%BD%E4%BA%92%E4%BD%9C%E5%88%B0AI%E5%A4%9A%E7%BB%84%E5%AD%A6%E7%9A%8430%E5%BC%A0%E5%9B%BE/
Author BoHuYeShan
Published at 2026年9月12日