周报|生物科技、生物信息学与新技术
周报|生物科技、生物信息学与新技术 本文信息由 AI 爬取+整理,经人工核验后发布。AI 爬取可能会有遗漏,欢迎在评论区补充。如有偏差,也欢迎指正。 本期覆盖时间:2026-03-22 ~ 2026-03-28(含) 这周生物信息学方向最值得关注的是三篇新论文:虚拟细胞生成模型 Lingshu-Cell、论文代码一致性检测 BioCon、Bio-LLM 安全防火墙 BioShield。三个方向看起来独立,但指向同一个趋势:生信领域对 AI 工具的要求正在从”能不能做”转向”靠不靠得住”。 一、本周新论文1. Lingshu-Cell:用离散扩散模型覆盖 18,000 个基因的虚拟细胞arXiv:2603.25240 | Submitted 26 March, 2026 | 领域:q-bio.QM 这是本周虚拟细胞方向最新的一篇,也是这条技术线上的最新进展。 背景:虚拟细胞目前在什么阶段 当前主流的单细胞基础模型(如 scGPT、Geneformer)做的是静态表示学习——把细胞状态编码成固定向量。这种方式在细胞分类、降维可视化等任务上效果不错,但有一个根本局限:它们只能描述现有数据,不能生成新的细胞状态。 虚拟细胞要解决的是更远的问题:给定一个从未在数据中出现过的扰动(比如某个基因的敲除、某种药物处理),预测细胞会变成什么样。这个任务要求模型不只是”记住”见过的细胞,而...
周报|生物科技、生物信息学与新技术
周报|生物科技、生物信息学与新技术 本文信息由 AI 爬取+整理,经人工核验后发布。AI 爬取可能会有遗漏,欢迎在评论区补充。如有偏差,也欢迎指正。 本期覆盖时间:2026-03-22 ~ 2026-03-28(含) 这周生物信息学方向最值得关注的是三篇新论文:虚拟细胞生成模型 Lingshu-Cell、论文代码一致性检测 BioCon、Bio-LLM 安全防火墙 BioShield。三个方向看起来独立,但指向同一个趋势:生信领域对 AI 工具的要求正在从”能不能做”转向”靠不靠得住”。 一、本周新论文1. Lingshu-Cell:用离散扩散模型覆盖 18,000 个基因的虚拟细胞arXiv:2603.25240 | Submitted 26 March, 2026 | 领域:q-bio.QM 这是本周虚拟细胞方向最新的一篇,也是这条技术线上的最新进展。 背景:虚拟细胞目前在什么阶段 当前主流的单细胞基础模型(如 scGPT、Geneformer)做的是静态表示学习——把细胞状态编码成固定向量。这种方式在细胞分类、降维可视化等任务上效果不错,但有一个根本局限:它们只能描述现有数据,不能生成新的细胞状态。 虚拟细胞要解决的是更远的问题:给定一个从未在数据中出现过的扰动(比如某个基因的敲除、某种药物处理),预测细胞会变成什么样。这个任务要求模型不只是”记住”见过的细胞,而...
本周 arXiv 生信论文三则:虚拟细胞、论文代码一致性、Bio-LLM 安全
本周 arXiv 生信论文三则:虚拟细胞、论文代码一致性、Bio-LLM 安全明天(03-28)会出两篇周报,覆盖 03-22~03-28。周报出来之前,先看三篇本周 arXiv 上刚出现的生信论文。 按重要程度排序,从虚拟细胞模型讲起。 一、Lingshu-Cell:覆盖 18,000 个基因的虚拟细胞生成模型arXiv:2603.25240 | Submitted 26 March, 2026 它做了什么Lingshu-Cell 提出了一个”细胞世界模型”的概念。它的方法是用掩码离散扩散模型(masked discrete diffusion model),直接在离散 token 空间中建模转录组的状态分布,并支持条件扰动模拟。 这个模型覆盖了大约 18,000 个基因的转录组范围,不需要事先做高变基因筛选,也不需要按表达量排序来选基因。这意味着它保留了完整的转录组信息,而不是只关注那些”变化最大的基因”。 在多种组织和物种上的测试结果显示,Lingshu-Cell 能够准确再现转录组分布、标记基因的表达模式和细胞亚型比例。也就是说,给定一个条件(比如某种细胞类型或某个扰动),它可以生成对应的转录组状态。 技术细节:为什么是离散扩散模型而不是连续扩散单细胞转录组数据有一个特点:它是稀疏的、非连续的。大量基因的表达量为零,很多非零值之间也不是连续的数值关系。用连续空间的扩散...
把 Geneclaw 跑起来,只要七步
把 Geneclaw 跑起来,只要七步昨天那篇解决的是“Geneclaw 到底是什么”。今天这篇不再谈谱系,只做一件更硬的事:把它真正跑起来,而且不是“命令敲完就算”,而是确认你装对了、命令走通了、失败时知道该往哪查。 这篇文章默认你已经知道两件事。第一,Geneclaw 不是基因分析工具,而是一个基于 nanobot 的自演化 Agent 框架。第二,我们今天的目标不是把它研究透,而是完成一次可信的本地首跑:环境对、依赖对、CLI 对、第一条流程能走。 很多人卡死,不是因为 Geneclaw 太难,而是因为一上来就 pip install,根本没先确认自己正在用哪个 Python、pip 是不是同一个解释器、网络能不能拉依赖、后面要不要 API key。这篇就按这个思路来。 而且这篇会优先按 Windows 用户来写。原因很现实:今天最常见的失败场景,本来就集中在 Windows——Microsoft Store Python、python 和 py 混用、PowerShell 激活脚本被拦、PATH 混乱、pip 装进了另一个解释器里。你如果是 macOS 或 Linux 用户,命令思路一样,只是个别命令要换写法。 先做一个 30 秒预检在你 clone 之前,先把下面三条敲出来。它们的价值比一上来安装大得多: 123python --versionpython -m p...
第一次跑 AI for Bio 开源项目:先看懂 ELISA,再动手
第一次跑 AI for Bio 开源项目:先看懂 ELISA,再动手很多人第一次点进一个开源 AI 项目,第一反应是找安装命令。看见 README 就往下拖,看见 pip install 就复制,看见报错再去搜。最后花了两小时,项目没跑起来,自己也不知道到底卡在数据、环境、网络,还是项目本身就不是给普通人一键跑的。 这类问题往往不是因为不会敲命令,而是更前面那一步没做:你还没判断清楚自己在面对什么项目。 ELISA 很适合拿来示范这件事。它不是一个纯概念论文,也不是成熟产品,而是典型的研究型系统:有论文,有公开仓库,有比较清楚的模块描述,也有交互和报告生成能力。这样的项目最适合拿来练一种能力——你不一定今天就跑通它,但你应该先学会判断:它是什么、值不值得投入、第一步该准备什么。 30 秒仓库体检:先不碰代码,先看这几件事点进一个 GitHub 仓库,真正先看的不是 src/,而是页面最上面那一层公开信息。你需要在 30 秒里回答五个问题。 第一,它到底在解决什么问题。ELISA 的标题是 ELISA: An Interpretable Hybrid Generative AI Agent for Expression-Grounded Discovery in Single-Cell Genomics。只看这句就够你先做第一层翻译:它不是单一模型脚本,而是 agent;它强调...
想跑开源 AI 项目,你至少先得看懂 Git、GitHub、README 和环境
想跑开源 AI 项目,你至少先得看懂 Git、GitHub、README 和环境很多人以为自己不会跑开源项目,是因为”技术还不够”。这话只对一半。更多时候,问题不是不会,而是把几层完全不同的东西混在了一起:Git 和 GitHub 没分开,README 和安装命令没分开,requirements 和环境变量没分开,数据文件和代码文件没分开,最后一报错就觉得自己”果然不适合搞开源”。 这篇不打算把 Git 从头讲到尾。目标更直接:把你第一次跑开源 AI 项目前必须分清的几个关键概念讲硬一点,顺便说清楚 AI 可以帮上什么忙。 一句话版本Git 是版本管理工具,GitHub 是托管仓库的平台。仓库不是压缩包,clone 不是单纯下载,README 不是装饰,环境也不等于”装了 Python 就行”。 如果这几句话你脑子里是糊的,那你后面碰到的很多报错,根本不是技术问题,而是理解层次错位。 仓库不是一包代码,而是一个工程现场很多新手第一次进 GitHub,会把它当作”代码下载站”。其实仓库最有价值的部分,经常不是代码文件本身,而是上下文。 一个仓库至少包含这些东西:项目当前在维护什么版本,最近有没有更新依赖,作者推荐你从哪里开始,别人已经踩过哪些坑,是否有 release,是否有 issue 里反复出现的安装问题。你如果只下载一个 zip,当然能拿到文件,但你会直接丢掉这些最关键的...
这 7 篇 Bioinformatics 论文,各自的看点在哪里
这 7 篇 Bioinformatics 论文,各自的看点在哪里这类”热点论文日报”最大的风险,是把人带进一种错觉:今天又多了 7 篇新论文,于是好像 AI for Bio 又同时在七八个方向上全面推进了一步。 但如果真这样读,最后通常什么都记不住。 更有用的读法不是把 7 篇都平均扫一遍,而是问一句更硬的话:今天这批新论文里,哪些信号值得记住,甚至会影响你接下来怎么判断一个方向值不值得继续追? 如果只抓最重要的,我觉得今天真正值得单独成篇的,不是 7 篇论文本身,而是下面这 3 个信号。 信号一:虚拟细胞开始从”像”走向”有生物学约束”今天最强的一条线,其实不是单篇论文,而是 CDT-III 和 CellFluxRL 放在一起之后呈现出来的方向变化。 先看 CDT-III这篇工作的名字已经很说明问题:Central Dogma Transformer III。 它不是只做一个局部任务,而是试图把 DNA → RNA → 蛋白质 这条更完整的中心法则链路拉进一个可解释 AI 框架里。日报里给出的信息也很关键: 它有双阶段虚拟细胞嵌入架构 一阶段模拟转录 一阶段模拟翻译 不只是追求预测精度,还强调可解释性 甚至已经碰到了药物副作用预测这种更接近下游应用的问题 这意味着什么? 意味着 AI 生物学里有一条很明显的推进,不再只是”拿一个模型去拟合一类生物数据”,而是开始更主动地...
这 7 篇 Bioinformatics 论文,各自的看点在哪里
这 7 篇 Bioinformatics 论文,各自的看点在哪里这类”热点论文日报”最大的风险,是把人带进一种错觉:今天又多了 7 篇新论文,于是好像 AI for Bio 又同时在七八个方向上全面推进了一步。 但如果真这样读,最后通常什么都记不住。 更有用的读法不是把 7 篇都平均扫一遍,而是问一句更硬的话:今天这批新论文里,哪些信号值得记住,甚至会影响你接下来怎么判断一个方向值不值得继续追? 如果只抓最重要的,我觉得今天真正值得单独成篇的,不是 7 篇论文本身,而是下面这 3 个信号。 信号一:虚拟细胞开始从”像”走向”有生物学约束”今天最强的一条线,其实不是单篇论文,而是 CDT-III 和 CellFluxRL 放在一起之后呈现出来的方向变化。 先看 CDT-III这篇工作的名字已经很说明问题:Central Dogma Transformer III。 它不是只做一个局部任务,而是试图把 DNA → RNA → 蛋白质 这条更完整的中心法则链路拉进一个可解释 AI 框架里。日报里给出的信息也很关键: 它有双阶段虚拟细胞嵌入架构 一阶段模拟转录 一阶段模拟翻译 不只是追求预测精度,还强调可解释性 甚至已经碰到了药物副作用预测这种更接近下游应用的问题 这意味着什么? 意味着 AI 生物学里有一条很明显的推进,不再只是”拿一个模型去拟合一类生物数据”,而是开始更主动地...
Geneclaw 不是基因工具,是一个自演化 Agent 框架
Geneclaw 不是基因工具,是一个自演化 Agent 框架很多人第一眼看到 Geneclaw 这个名字,会直觉地把它归到”Bio / 基因研究工具”那一类。毕竟名字里带了个 gene,做 AI for Bio 的人很容易觉得又来了一个单细胞或者组学相关的开源项目。 但如果真的去看它的 README 和官网,会发现它和基因研究没什么关系。 先把定位说清楚Geneclaw 官方给自己的定义是:Self-Evolving AI Agent Framework,中文来说就是一个自演化的 AI Agent 框架。官网首页的第一句话就直接写的是 “Safe, Auditable Self-Evolving Agent Framework”——安全、可审计的自演化 Agent 框架。 它和单细胞分析、基因序列处理、表达矩阵这些生物信息学任务完全无关。它的核心目标是:让 AI Agent 改代码这件事变得可追踪、可回滚、可审计。 三代演化脉络把 Geneclaw 放进它该在的技术谱系里,故事其实很清楚: 第一代:OpenClaw(也就是本工具所在的底层框架)最初始的系统,用的是 Node.js。一个早期的 AI Agent 框架,奠定了”cloud brain”的基础架构。 第二代:nanobot在 OpenClaw 基础上,用 Python 重写了核心逻辑。它把 Agent ...
为什么生物信息学也开始需要 AI agent 的评测体系
为什么生物信息学也开始需要 AI agent 的评测体系过去一段时间里,大家讨论 AI agent,很多时候重点都放在“又做出了什么能力”上。 比如它能不能自己拆任务、能不能调工具、能不能跑一个 workflow、能不能生成完整报告,或者能不能在某个专业场景里把原本需要人工串起来的步骤自动接过去。生物信息学当然也不例外。随着越来越多 agent 开始进入 RNA-seq、变异检测、宏基因组分析、单细胞分析这些任务,很多人最关心的问题自然会变成:它到底能不能做事? 但如果这个方向继续往前走,迟早会撞到另一个更关键的问题:它到底靠不靠谱? 这也是为什么我觉得今天查到的 BioAgent Bench 很值得单独写一篇。因为它做的不是再造一个新 agent,而是在补一个以前很容易被忽略、但其实越来越重要的东西:评测体系。 一、为什么 AI 进入生物信息学之后,光看“能跑通流程”已经不够了很多 AI agent 的演示都很吸引人。给它一个任务,它能自己拆解步骤、调用命令、生成结果文件,甚至最后还给你一份像模像样的总结。第一次看这些系统的时候,很容易觉得它们已经快接近“自动化研究助手”了。 但真正做过生物信息学工作的人都知道,事情没有这么简单。 因为生信任务和很多轻量级自动化任务不一样,它往往同时具备几个特点: 流程长:不是一步到位,而是一串依赖关系很强的步骤 中间状态多:每一步输出都...