从 2.62 TB 到 5,120 token:蛋白质模型的部署阶梯
ColabFold 1.6.3 全量 pip 安装、老卡 2.5x、ipSAE/pDockQ2 进主输出;AF2 的 monomer 推理被塞进手机浏览器。这篇按官方口径排一张部署阶梯:2.62 TB 的库、5,120 token 的 80 GB 担保线、940 GB 的绝对本地、免费层半小时的首跑——外加一张场景选型边界表,和为什么结果接近不等于认可等价。
9 月 14 日,ColabFold 发布 1.6.3。同一个月更早的时候,Martin Steinegger 的一个实验页面安静上线:在手机浏览器里,直接跑 AlphaFold2 的单链推理。费电、发热、烧流量,但它跑通了。
一头是巨头在云端堆十亿级结构,一头是有人把 AF2 塞进手机浏览器。这两件事之间隔着什么?隔着一整条部署阶梯。这篇把折叠模型的部署形态按门槛排成一张表,从 2.62 TB 的数据库到手机浏览器里那点算力,顺带回答三个问题:16 GB 显存到底能干什么,该把自己放在阶梯的哪一级,以及为什么「结果接近 AF3」不等于「论文里可以写 AF3」。
一、先说新闻:1.6.3 的三件事#
ColabFold 这条线的基本盘是「云端 MSA + 免费 GPU」:序列比对交给 MMseqs2 服务器,预测跑在 Colab 的卡上,用户一个本地环境都不用装。1.6.3 这版把「本地」这条腿也补上了:
| 更新 | 内容 | 含义 |
|---|---|---|
| 全量 pip 安装 | pip install colabfold[alphafold] | 不再依赖 notebook 环境,自托管从「能折腾」变成「一条命令」 |
--use-fast-kernels | Turing/Volta 架构的老卡(T4、V100)大幅提速,作者口径 2.5x | 实验室里压箱底的老卡重新有了用武之地 |
| ipSAE / pDockQ2 | 界面置信度指标直接进主输出 | 复合物预测的「这条链和那条链是不是真结合」有了标准化读数 |
顺带修了两个 bug,其中一个是 1.6.2 的 --use-pallas 在特定头维度下静默算错点积。科学计算里最阴险的就是这类「不报错、只给错答案」的问题——这也是为什么上周拆那份可复现性基准时,验收学要单独写一节。
前瞻部分同样值得关注:仓库里出现了 ColabFold2_preview.ipynb,以及一条 af3-preview 分支(pip install "colabfold[alphafold3]@git+https://github.com/sokrypton/ColabFold@af3-preview")。都标着 preview,但方向清楚:AF3 这一代的推理,ColabFold 打算原样接管。
二、真正跑进手机的那扇门#
比 1.6.3 更有意思的是另一个页面。它的副标题原话是:Run AlphaFold2 monomer inference locally in your browser with WebGPU——AlphaFold2 的单体推理,在浏览器里、在本地设备上完成,由 Martin Steinegger 发起。
先泼三盆冷水,作者帖里自己写的:费电池、会过热、烧流量。然后是两个技术边界:
一,只支持 monomer。 复合物、配体、核酸,都还不在便携范围里。
二,模型在本地,比对在云端。 MSA(多序列比对)仍由 ColabFold 的公共服务在线生成。这一条决定了它「烧流量」——也决定了折叠模型离真正的端侧还有多远。这个依赖后面还会反复出现。
所以定位要说准:这是实验性演示,「能跑」不等于「能用」。但它是一块浮冰——推理下沉到端侧这条路,折叠模型这边第一次有了实打实的立足点。
三、部署阶梯:从 2.62 TB 到 5,120 token#
把目前的部署形态排成一张表,每一格的数字都来自官方文档,不是估计:
| 部署形态 | 代价 | 换来什么 |
|---|---|---|
| AF2 原生(真开源) | 仅 Linux;下载 556 GB、解压 2.62 TB、预留 3 TB 盘;官方参考机 A100 + 85 GB 内存 | 机构级的完整能力,权重自由使用 |
| AF3 本地 | 代码 Apache 2.0;权重受专门条款约束(非商业、禁止再训练);约 1 TB 数据库;官方只在 A100/H100 80 GB 上验证过 5,120 token 满载 | 当代最强复合物预测,但显存和条款双重门禁 |
| ColabFold 云端(默认) | 免费额度、排队 | 零部署门槛,16 GB 级免费卡就能跑 |
| ColabFold 绝对本地 | 建库 940 GB;batch 搜索约 128 GB 内存;索引常驻内存版要 768 GB–1 TB | 全程离线,数据不出域 |
| AF2 进浏览器(WebGPU) | monomer;MSA 仍云端;手机电池与流量 | 推理端侧化的第一步 |
几个数字值得单独说。
16 GB 显存能干什么? ColabFold 官方 FAQ 的原话:约 16 GB 的卡,最大长度约 2,000 残基。这是 AF2 时代的实用天花板。
80 GB 是什么线? 不是「至少 80 GB 才能装」,而是 AF3 官方文档的担保线:输入不超过 5,120 token 时,官方只在单张 A100 80 GB 或 H100 80 GB 上验证过。低于这个配置不是不能跑,是官方不为你的规模背书。
token 这笔账#
5,120 这个上限里藏着一个容易忽略的定义问题:AF3 的 token 是统一计数单元——蛋白残基 1 个 token,核酸碱基 1 个 token,配体按原子数计。
所以「预设它结合一个小分子」不是加一个分子,是加几十上百个 token。复合物越大、配体越多,撞墙越快。显存封顶的是体系规模,不是精度——官方原话就是 “GPUs with more memory can predict larger protein structures”,更大不更准,只更大。
顺带一个容易被忽略的细节:AlphaFold Server 网页版自己的 token 上限是 5,000,比本地的 5,120 担保线还要紧一点。云端大方,但不是不设防。
笔者的实测体感在 AlphaFold Server 网页版上:两个蛋白对接,十几分钟起步;先提交两个任务把服务「焐热」,后面的 400–600 残基链才能稳定在四五分钟一条——不预热的话,首跑半小时起步,甚至直接卡死。至于原生部署那套(3 TB 盘 + A100 起步),个人自己折腾纯属浪费,这条阶梯的下半段本来就不是为个人准备的。
四、折叠模型为什么在变轻(我的理解,不是拆解)#
先划边界:Evoformer 内部的消息传递、三角更新的机制细节、蒸馏与再训练的门道,这篇不碰——AF2/AF3 本体是计算生物学家的主场,我的水平不够拆它,只谈理解。
我理解的趋势是组件替换。AF2 引以为傲的三角更新,是蛋白质领域专门设计的组件;2025 年苹果的 SimpleFold 反其道行之,用纯通用的 Transformer 层加流匹配把它换掉,30 亿参数拿到 AF2 九成性能、约一成算力,轻到消费级笔记本能跑(上一篇算过这笔账)。WebGPU 移植是同一个方向的工程面:只有当模型由通用组件构成,浏览器和消费硬件的生态才接得住它。
领域专用组件换通用组件,换来可部署性,付出去的是前沿精度。这笔权衡现在还没收敛,两条线都活着。
五、下沉到哪一层:一张选型边界表#
阶梯摆完了,真正的问题是:你该站在哪一级。 这张表按场景给答案,卡点一并列出:
| 场景 | 建议层位 | 卡点 |
|---|---|---|
| 课堂演示、科普、快速查一个结构 | AlphaFold Server 网页版 | 免费但每天 30 个 job;服务端 token 上限 5,000,配体一加就紧 |
| 日常单链与复合物预测,数据可以出域 | ColabFold(notebook 或 pip 版) | 免费卡有限额;16 GB 显卡约 2,000 残基封顶 |
| 未发表序列、企业内部数据,不能出域 | ColabFold 绝对本地 | 940 GB 建库加约 128 GB 内存的门槛 |
| 复合物 + 配体 + 亲和力,且要能商用 | Boltz-2 / Protenix v1 / Chai-1 | 结果需自己验收;16 GB 只覆盖中小体系 |
| 手机端现场查看 | AF2 WebGPU 浏览器 demo | 实验性;仅 monomer;MSA 仍走云端 |
三条选型原则,按优先级排:
一,数据出域是第一约束,不是算力。 未发表序列一旦贴进公共服务,就当它已经公开。机构在意的从来不是你烧几张卡,是你把什么传给了谁——绝对本地那 940 GB 存在的全部理由就是这个。
二,按体系规模选层,不按牌子选。 5,120 token 的官方担保线、16 GB 的 2,000 残基线,先把问题的规模算出来,再挑层。顺序反过来,只会浪费排队时间或者买错卡。
三,免费层的排队成本也是成本。 半小时起步的首跑、十几分钟的二聚体,乘上课题周期就是真实工期——有时候一次绝对本地的建库投入,比长期排队便宜。
六、结果接近,不等于认可等价#
讲到 AF3 的替代品,就得讲清开源阵营的真实位置。目前三个代表:
- Boltz-2(MIT 与 Recursion):MIT 协议全开源,第一个把结构预测和亲和力预测做在一起的共折叠模型,中小体系单卡 16 GB 级可跑
- Protenix(字节):v1 代码与权重 Apache 2.0、明确可商用,技术报告口径在相同数据规模下超过 AF3——但 v2 的权重已转闭源,开源收紧的信号值得记一笔
- HelixFold3(百度):结果上无限接近 AF3,许可却是 CC BY-NC-SA,商用没门;部署在它自家的平台才顺手
但读论文的时候你会发现另一件事:方法部分的预测工具一栏,作者们写的仍然是 AlphaFold、AlphaFold-Multimer。开源替代品拿得到接近的分数,拿不到引用里的名字。
而让这件事更微妙的是谷歌的大方。AlphaFold Server 每人每天 30 个 job,免费;一个课题组只要有几个人注册谷歌账号,日常发论文需要的预测量基本就摊得开——连「自己部署」的必要性都被直接瓦解了。其他模型的生态难就难在这:它们不是输在结果,是输在正版免费。 生态锁从来不一定要靠收费,大方同样能锁死一个市场。
顺着这个机制还能推出一个不太好听、但大概率成立的预测:既然开源模型的结果「差不多能用」,而审稿人要看的只是方法栏里 AlphaFold 这几个字——那么拿其他模型的输出、在论文里标成 AlphaFold 结果的操作,恐怕不会少。开源模型拿不到名字,名字却可以被白嫖;认可墙走到极端,就是认可被冒领。这话没法统计,只能算机制层面的推断——哪天有人认真去对一遍论文预测结构与所用工具的匹配度,估计会很有意思。
这不是技术问题,是认可问题——而认可本身就是验证闭环的一部分。巨头那篇里说过:验证闭环厚的层,才是领域人的壁垒。开源模型要翻的是三面墙:认可(学界引用习惯)、许可(非商业条款)、部署(离开自家平台就不顺手)。三面墙里,代码墙最先倒,认可墙最难翻。
学术复现是慢变量:OpenFold 复现过 AF2,OpenFold-3 的预览也在路上,目标是逐位复现 AF3。学术界补位总是慢半拍,但从不缺席。
七、阶梯收拢#
整条阶梯收拢成一句话:能力每上一级,依赖就重一截;依赖每重一截,能自由用它的人就少一批。 2.62 TB 的库锁住机构层,5,120 token 的担保线锁住云端之外的规模,940 GB 的建库门槛锁住数据不出域的需求,手机浏览器那点算力只够 monomer——每一级的门槛都是诚实标价的。
对生物人的落位:先用最上层把问题做起来,AlphaFold Server 和 ColabFold 的免费额度足够起步;等问题规模和数据敏感性把需求顶到哪一级,再上哪一级——顺序反过来就是浪费。巨头占着最上面几级台阶,中间的台阶属于会按需选层的人。
上这张牌桌,依然不需要苹果的预算。
数据口径#
- ColabFold 1.6.3(2026-09-14 发布):pip 全量安装、
--use-fast-kernels、ipSAE/pDockQ2、--use-pallas与single_sequence修复——GitHub Release ↗;「2.5x 提速(含 T4/V100)」为作者 Milot Mirdita 发布帖口径;ColabFold2_preview.ipynb与af3-preview分支均在仓库主干可见 - AF2 WebGPU 移植:项目页 ↗,副标题与「MSA 由 ColabFold 公共服务提供」为页面原文;「电池/过热/流量」警告出自作者发布帖
- AF2 部署要求:官方 README ↗——仅 Linux、556 GB 下载、2.62 TB 解压、3 TB 盘、参考机 12 vCPU/85 GB 内存/A100、权重 CC BY 4.0
- AF3 部署要求:官方安装文档 ↗——约 1 TB 盘、Compute Capability 8.0+、5,120 token 满载仅在 A100/H100 80 GB 验证、建议 64 GB 内存;token 计数方式(残基/碱基/配体原子)为官方输入文档口径;权重条款以其仓库
WEIGHTS_TERMS_OF_USE.md为准 - ColabFold 本地化:940 GB 建库、batch 搜索约 128 GB 内存、索引常驻 768 GB–1 TB、约 16 GB 显卡最大长度约 2,000 残基——均为仓库 README 与 FAQ 原文
- Boltz-2 的 MIT 许可与亲和力能力、Protenix v1(Apache 2.0)与 v2(权重转专有)的许可变化、HelixFold3 的 CC BY-NC-SA、Chai-1 的 Apache 2.0(README 口径),均以各自仓库当前 README/许可文件为准;OpenFold-3 为其仓库预览页口径
- AlphaFold Server 免费额度:每人每天 30 个 job、服务端 token 上限 5,000——官方 FAQ ↗ 与 EBI 使用指南同口径(2026 年 1 月第三方教程亦确认 30/日);「多账号摊薄额度」「借名标注结果」为基于机制的推断,非实证统计
- 「预热后四五分钟、二聚体十几分钟、首跑半小时或卡死」为笔者在 AlphaFold Server 网页版的实测体感,非基准测试,仅供参考量级
- 第五节选型表为本文基于上述公开口径的整理与判断,非任何官方建议