训练大模型教会我的事,后来都用在了生物医药上
我的简历里有一行字:训练过语言模型。一行字背后是几百天的时间。从搭数据管线、训到一半 loss 炸了重来、把整套东西搬到华为昇腾 910B 上再踩一遍坑,到后来发现这套”训练语言模型”的思维居然能一路迁移到蛋白质预测、再迁移到 AI 药物对接——这篇文章就是把这三次迁移完整讲一遍。 先交代清楚开源状态:医药侧(蛋白质、药物)的代码和模型,我暂时没有开源;语言模型侧的代码和仓库,在简历 V1 里提到的启智社区(OpenI)个人主页可以看到:openi.pcl.ac.cn/bhys。所以下面讲方法论和踩坑为主,代码点到为止。 第一部分:从零训练大语言模型,我踩过的坑架构别发明,抄已经收敛的模板训练 LLM 最反直觉的一件事是:架构设计在这个年代几乎不构成竞争力。Stanford CS336 课程的 Tatsu 讲过一句话我印象很深——2024 年大家都在 cosplay Llama2,2025 年的主题是”怎么训得不崩”,2026 年变成”怎么扛住长上下文”。我自己的经验印证了这一点:把主流开源模型的架构参数并排放在一起,90% 的维度几乎一模一样: pre-norm:LayerNorm 挪出残差流,梯度反传更稳 RMSNorm 替代 LayerNorm:减均值加 bias 那部分没帮上忙。RMSNorm 只做缩放不做平移: RMSNorm(x)=x1d∑i=1...
两条路进入生物信息学,然后在 AI 时代交汇
生物信息学有一个少被明说但每个人都心知肚明的现实:这个领域的人来自两个截然不同的起点。 有人是从计算机科学、软件工程、数学物理”跨”过来的——会写代码、懂算法,但在第一次拿到 RNA-seq 数据时,连”什么是文库、什么是接头、为什么要去重”都要从头学起。 有人是从生物学、医学、农学”转”过来的——做过 PCR、跑过胶、养过细胞,但在第一次面对终端窗口时,连 ls 和 cd 的区别都要查半天。 这两类人最终都在做同一件事——从生物数据里找答案。但他们走的路径、用的工具、面对的困难,完全不一样。 而 2026 年,AI 的介入让这两条路开始交汇了。但交汇的方式可能和大多数人想的不一样。 第一条路:从代码出发程序员转入生信的典型路径是:因为某个课题或项目需要分析生物数据,发现自己能写脚本、能调包、能搭环境,于是自然而然地接手了组里的计算任务。 这条路的人对以下场景不会陌生: 写 Python 脚本处理 FASTQ,用 Biopython 解析序列 搭 Snakemake 或 Nextflow 管线,把比对→定量→差异表达串起来 用 Docker/Singularity 管理环境,确保结果可复现 写 R 脚本画热图、火山图、GO 富集条形图 这是典型的 gII(脚本管线)和 gIII(工作流管理器)的工作方式。它高效、灵活、可扩展。一个写 Nextflow 管线的...
别再问哪个 Agent 最强——它们连活法都不一样
别再问哪个 Agent 最强——它们连活法都不一样过去一个月我被问得最多的问题就是:”哪个 Agent 最强?” 这个问题没法回答,因为它预设了一个不存在的前提:所有 Agent 在赛同一条赛道。事实是,我把 47 个 Agent 摆在一起、逐个翻完 README 之后,发现它们连”活着的方式”都不一样——有的把一切交还给你,有的替你焊死所有流程,有的在你睡觉时偷偷学习你,有的干脆把自己拆成一堆可替换的零件,还有的压根不卖 Agent,卖的是它背后那朵云。 用”强弱”去比它们,就像用百米成绩去比较潜水员和登山运动员。 有一个数据能说明框架比模型更决定结果:同一个模型,换一个框架跑,表现能差 5–40 个百分点(Claude Opus 在 Claude Code 里 77 分,在 Cursor 里 93 分)。模型是灵魂,框架是身体——灵魂再好,装错身体也跑不动。 所以我做了一个自测网页:处境题加认知题,分三档深度——极速 20 题(处境+认知)三分钟出结果;详细 70 题在处境之外加需求、展望两个维度;专业 180 题把认知扩到 12 个维度,给从业者和重度玩家。答完给你推荐几个值得先试的,而不是一个”冠军”。拿不准的题可以标记,答完会建议你升级到更细的版本。这篇文章是它的说明书——讲清楚这 36 个东西到底分几类,每一类的设计哲学是什么,README 里是怎么自我介绍的,以...
你手里的 AI,和别人手里的不是同一个 AI
你手里的 AI,和别人手里的不是同一个 AI前阵子参加了一场 AI 工具的线下交流会(城市不说,公司名也不说,都不重要)。会上有个现象很有意思:科班出身的、半路出道的、文科背景的,各讲各的,彼此的观点几乎无法对话。 一位半路出道的开发者上台,要向大家分享一个”听到就绝对不可能”的东西——一个零 Bug 的 skill,用来开发小程序,一定一次通过,没有 bug。 同一场里,另一群人在聊的是:定期抓一遍开源社区的热点、做成 RSS 推送这种工作流,去年就已经能靠 AI 百分百复现了,效果还很好。 这两拨人坐在一个房间里,用着同一个词——“AI”——在描述两个完全不同的东西。 我一开始以为这是水平差距。后来想明白了:不是观点不同,是手里的东西根本不是同一个。 同一场会里至少叠着四层分裂,每层都会让上层的讨论失去共同基础。 上一篇讲的是宏观层面:AI 把成本从”做出来”搬到了”判断对不对”上。这一篇往下钻一层,讲一个更前置的问题——为什么大多数人连”AI 到底好不好用”这个最基本的判断都做不出来。 答案有点难堪:因为你根本不知道自己手里拿的是什么。 一、模型层:你没见过它真正的样子先说最基础也最少被提起的一层:免费 chat 界面里的模型,从来都是 API 的严重缩水版本。 这不是猜测,是这个行业的通行做法。网页端和 App 端要扛住海量的并发,给你的是经过量化的、上下文被截断...
从 "Show me the code" 到 "Show me the talk":AI 把稀缺性翻了个面
从 “Show me the code” 到 “Show me the talk”:AI 把稀缺性翻了个面2000 年 8 月 25 日,Linux 内核邮件列表上正在吵线程性能。当时 SCO 声称自家的线程创建速度比原生 Linux 快一千倍,一群人你来我往,从信号处理谈到 PID 语义再谈到 POSIX 规范,越吵越理论化。Linus Torvalds 扔下一句:”Talk is cheap. Show me the code.” 二十六年过去,这句话被印在无数 T 恤上,成了程序员世界的实力主义宣言:你是谁不重要,学历不重要,PPT 不重要,能跑起来的代码说明一切。 但 2026 年的今天,这句话正在被人反过来写——Code is cheap. Show me the talk. 这个翻转不是文字游戏。它背后是一个更硬的事实,也是这篇要讲清楚的唯一一件事:AI 没有消灭成本,它只是把成本从”做出来”搬到了”判断对不对”上。你之所以用 AI 越用越忙,不是姿势不对,是你正好站在成本被搬过去的那一侧。 而且这件事不是第一次发生。人类二十年前就踩进过同一条河,只不过那次的触发因素不是 AI,是 Git。 上一篇讲的是个人层面:你写不出合格提示词,是因为你说不清输入,也说不清什么叫做对。这篇往前推一层——为什么现在连有能力验收的人,都开始跟不上生成速度了。 一、三份账单先看...
和AI磨出一篇批判文章:多轮协作写作方法论(文末附可复用Skill)
和AI磨出一篇批判文章:多轮协作写作方法论(文末附可复用Skill)今天同时发布的那篇词元文章,不是一次成稿的。它从一句带着情绪的语音输入开始,经历了十几轮往返:我发散观点、拍板框架,AI 核查事实、纠正我的错误,我再纠正它的错误,最后磨出一篇带十六条参考文献的批判长文。这个过程本身就是一个相当典型的”AI 辅助写作”实践样本。这篇文章把整个协作过程拆开复盘,提炼成一套可以复用的方法论——文末附上整理好的 Skill,下次写考证型文章可以直接加载。 第一课:先核查,再开火——AI 的第一个贡献是反转了靶子事情的起点是一句愤怒的语音输入:人民日报说 token 就是词元,事关科技话语权,这文章太蠢了。如果当时顺着情绪直接开写,出来的就是一篇纯泄愤的檄文,而且大概率会打错靶子。 AI 做的第一件事不是写,是查。查完发现了一个关键反转:全国科技名词委 3 月 25 日的公告其实做得很克制——标题写明”人工智能领域”,程序是”发布试用”,还留了”结合社会推广应用情况最终确认”的口子。真正有问题的,是前一天报纸那篇抢跑宣布”中文名定了”的报道,和五个月后把译名问题升格成”话语权危机”的锐评。 这就是协作的第一课:情绪指认的靶子和事实上的靶子,经常不是同一个。人的愤怒指向的是”谁让我不爽”,核查回答的是”到底哪一步出了问题”。把靶子找对,后面的十几轮讨论才没有白费——如果一开始就把名...
Token译成“词元”没有错,把外来词当成危机才是文化不自信
Token译成”词元”没有错,把外来词当成危机才是文化不自信今年三月,《人民日报》报道了国家数据局局长在中国发展高层论坛上用”词元”指代 Token,标题直接叫《”Token”中文名定了:词元》[1];四个多月后,人民网观点频道发了一篇《人民锐评:用”Token”还是”词元”,事关科技话语权》,把这条产业新闻升级成”母语体系被消解的深层危机”[2]。两篇原文我都找来逐句读了,结论是同一句话:给 Token 定一个中文名,没有任何问题;有问题的是这两篇文章处理这件事的方式——一篇是抢跑加一刀切,一篇是上纲上线。 先把引用来源全部列出,分三组:被评论的矛盾文献、事件与制度文献、语言与历史辅佐文献。正文所有直接引语都出自前两组,历史论断的佐证在第三组,欢迎逐条核对: 一、主要矛盾文献(本文评论对象) [1] 王萍萍、王云杉:《”Token”中文名定了:词元》,《人民日报》2026年3月24日第08版,人民日报客户端同步推送:https://www.peopleapp.com/column/30051714161-500007408568 [2] 李玮:《人民锐评:用”Token”还是”词元”,事关科技话语权》,人民网-观点频道,2026年8月5日:http://opinion.people.com.cn/n1/2026/0805/c436867-40774551.html 二、事...
你不会写提示词的真正原因:不是话术不够,是没法验收
你不会写提示词的真正原因:不是话术不够,是没法验收很多刚摸生物信息学的人都揣着同一个默认假设:AI 连代码都能写了,我还学什么代码。然后第一次动手就卡住——不是卡在写代码上,而是卡在提问上。让 AI”帮我做个单细胞分析”,它回你一大段看起来很专业的东西,跑不通;把报错最后一行贴过去问”怎么办”,它开始猜,你跟着乱改,越改越乱。最后归因成两句话:”我果然不适合做这个”,或者”我去学学提示词工程”。这两个方向都不对。这篇只讲一件事:你的问题不是不会说话,是你既说不清输入是什么,也说不清什么叫做对。 上一篇讲的是通用的自查顺序:先看 Agent 模式开没开,再谈目标描述、授权和基建。这篇不重复那张分层表,而是往下再挖一层,只对生信新手回答一个更前置的问题:为什么你连”把问题描述清楚”这一步都迈不过去——答案通常不是懒,也不是话术不够,是你的知识结构里还没有可说的东西。 先摆一个观点:提示词不是话术,是说明书加验收标准市面上的提示词课大多在教话术:要角色扮演,要说”请你扮演资深专家”,要加上”一步一步思考”。这些有点用,但都是次要的。一份能用的提示词,本质上是两样东西:一份足够完整的需求说明书,加一套判断输出对不对的验收标准。 这也解释了一个现象:同一个人,让他写”帮我把这段中文翻译成英文”,提示词清清楚楚;让他写”帮我处理这批测序数据”,立刻语无伦次。不是他突然不会说话了,而是...
效果不好别急着怪模型——你可能连 Agent 都没开(一层层自查,看清你卡在哪)
很多人对 AI 的态度,建立在两个错误上。 一个是用的时候:效果不好,第一反应是”模型不行”。但有没有一种可能——你是在 chat 模式裸用的,连工具都没给;或者你甩了一句”帮我优化下”,然后怪它没懂你。 另一个是评的时候:拿一道”洗车店 50 米该开车还是走路”的残缺题去考 AI,AI 答”走路”就被制成表情包全网嘲。可那道题在传播中,早把”我想洗车”这个条件弄丢了。 这篇不聊怎么调 prompt 的玄学,而是给你一张分层自查表:你用不好 AI,基本就是下面四层里某层卡住了;而网上那些”AI 翻车”的笑话,往往也是出题人自己没说清。 先自测一下,答”否”越多,你越该往下读: 你用 AI 时,开的是 Agent、给了工具,还是一直拿对话框当万能? 你提需求,是”明确可验收的目标”,还是”帮我弄个好用的东西”这种猜谜? 你会不会把规划放权给强模型、让一般模型执行,并按任务选模型方向? 你会不会配 harness、权限、上下文,让分工真正落地? 这四层从下往上,顺序不能反。下面一层层拆。 一、先定位:你卡在哪一层的”使用断层”很多人以为”用不好 AI”是个单一问题,要么怪模型、要么怪自己不会写 prompt。但真正的情况是一张分层图——你大概率是其中某一层断了,而且往往是最底下那层。 层 它在解决什么 典型症状(中了几条?) L0 模式层 你给没给 AI 工具...
别让 AI 心算:你以为在测它,其实只是没给草稿纸
又看到有人做”AI 测试”了:挑五道专业课真题丢进网页对话框,回来对了三道半,于是下结论——“所谓大模型,专业水平堪堪及格,数学更是一塌糊涂,大家别神化。” 评论区一片附和。但我盯着这条帖子看了很久,因为它从头到尾建立在一个错误的预设上:他在考一个不许打草稿的学生。 一、先分清两种模式:chatbox 和 Agent今天大部分关于”AI 强不强”的争吵,参与者连自己在用什么模式都没分清。 chatbox 模式,就是那个最熟悉的输入框:你打一句话,模型回一段话。中间没有工具、没有执行环境,模型是”裸”的——它只能靠参数里记住的东西直接开口。网页版默认是这样,很多手机 App 也是这样,甚至不少”桌面客户端”也是这样。顺带补一个很多人一直没搞清的概念:相当一部分桌面 AI 应用,本质就是浏览器内核套了个壳,和你开的网页标签没有代差。判断一个产品处在什么模式,不看它的窗口长什么样、要不要下载安装,只看它背后给模型接了什么能力。 Agent 模式,则是给这个”裸模型”配上了手和脚。它能做的事情至少多了三样: 打草稿做计算——写一段代码,真的跑起来,看着输出说话; 编写文件——把中间结果、最终交付物落成真实的文件,而不是全挤在聊天记录里; 深度搜索——这个下面单独讲,因为它和 chatbox 的”联网”完全是两回事。 能力 chatbox 模式 Agent 模式 算...