神之一手之前,先收棋谱:模型厂商为什么给学生白送额度
Google 给学生免费送一年 AI Pro,GitHub 学生包里打包了各家模型订阅——推理成本是真金白银,厂商却抢着白送。这笔账有两层:毕业生身上的肌肉记忆是未来的定价权;学生用真实课题换额度的过程,是一张张高价值的「棋谱」。围棋是越新越强的运动,AlphaGo 的神之一手来自人类棋谱之外——而今年的成绩单上,自主科研四跑三败、二十项任务只赢四项。收谱,还没收够。
〇、一张免费的账单#
先看两个具体的动作。
Google 现在向符合条件的大学生免费送整整一年 AI Pro:四倍的 Gemini 用量上限、5TB 存储、Workspace 集成,还专门做了个「Gemini 学习中心」(TechRepublic ↗、Mashable ↗,2026 年内有效,最晚年底兑换)。GitHub 那边,学生开发者包(Student Developer Pack)除了老三样,开始直接打包 Copilot Pro 和各家主流模型的订阅——有学生实测靠这一个包免费用到第一梯队的闭源模型(说明 ↗)。
国内这边是同一张时间表的另一个时区。AI 编程工具的三巨头——腾讯 CodeBuddy、阿里 Qoder、字节 Trae——把「学生认证」做成了标准营销位:阿里云大学计划 ↗里 Qoder 学生专享一个月专业版免费抵扣;豆包 8 月上线学生认证 ↗,认证后免费额度翻到 2.5 倍、专业版 38 元/月(原价 68)——而字节在 8 月底把 TRAE、扣子团队整体并入豆包体系 ↗,编程线和工作线收进同一个入口。跟进的名单还在加长。
免费的东西最贵,这话人人会说。但这次的白送和历史上所有教育折扣都不一样,差别写在成本结构里:软件时代送的是副本——复制一份的边际成本趋近于零,教育折扣只是放弃本来也收不到的钱;这次送的是算力——每一次模型调用都是真金白银的推理成本,用得越多,厂商贴得越多。
贴钱请最穷的用户用最贵的服务,这生意图什么?账要往两层里看。第一层写在明面上,第二层写在棋盘上。
一、第一层账:习惯,即未来的定价权#
明面上那层不新鲜,软件时代就跑通过三遍。办公套件对校园里流传的「非授权拷贝」睁一只眼闭一只眼;专业设计软件把教育版定价压到象征性的一折;操作系统给学校机房整批白送授权。当年这些动作被骂作纵容盗版,后来全被证明精明:学生在哪套工具上长出肌肉记忆,五年后采购清单就写哪家的名字——盗版份额就是未来的市场份额。
大模型厂商做的是同一件事的升级版,而且升级了两次。
第一次:把「纵容」改成「官方福利」。不用再默许灰色地带,直接给认证通道,还顺便赚一轮口碑。
第二次,也是订阅时代特有的:把锁定做进了工作流本身。软件时代的迁移成本是重装一套工具;大模型时代的迁移成本是你养出来的整个使用习惯——几百条调教好的指令模板、沉淀在对话里的上下文、跟模型磨合出的提问方式、围绕某一家 API 搭起来的脚本和管线。毕业五年后换个模型,等于把肌肉记忆扒一层皮。锁不是合同写的,是长在用户身上的。
这一层讲完了。如果只是这样,那不过是老剧本翻拍。新鲜的是第二层——那一层解释了为什么贴的钱比软件时代多得多也舍得:因为这次送出去的每个账号,本身就在生产一种买不到的东西。
二、第二层账:棋谱#
大模型行业有一个所有厂商共同面对的问题:高质量数据见底了。
这件事有三个可见的形态。公开文本被爬到底——互联网上像样的语料几轮下来全进了训练集;合成数据能续命——模型自己生成自己训练,但吃多了会「近亲繁殖」,分布越收越窄;基准在污染——考题漏进了教材,分数开始失真。三条路都越走越窄之后,剩下最后一块高价值语料浮出水面:真实工作流的完整轨迹。一个人面对真问题,从理解、规划、试错、失败到修正的全过程,一步不剪。
这种数据网上没有。论坛帖子是成品,教程是修剪过的路径,代码仓库是终态快照——唯独「带着模型干一件真实的事、边干边反馈」的过程,只能现场采集。而采集这种数据没法雇人造假:给标注员发钱让他们「假装做科研」,做出来的是表演,不是轨迹。要看真轨迹,只能去找真的在做事的人。
于是问题变成:谁的课题最真、反馈最密、试错最狠?
学生。研究生拿真课题开题——失败就是失败,答辩不认表演;本科生的毕设一学期一个完整周期,从零到交付正好是一份带全部中间态的记录;最关键的是反馈的密度:跑不通的环境、不对劲的结果、推翻重来的思路——每一个负样本都在标注「这条路不通」。在强化学习的语言里,负样本恰恰是最贵的样本:赢棋的谱教你怎么赢,输棋的谱教你哪里是坑。
免费学生额度,本质上是一张全球分布式采谱网。数百万个真实课题的过程,一局一局收进训练管线。这也解释了为什么各家偏偏送学生额度、而不是全民降价——降价买的是用量,学生计划买的是谱。
三、最鸡贼的一层:学生不脱敏#
棋谱那层账还有一个更锋利的切面,值得单独摆出来。
职业程序员对待模型有一套多年养成的卫生习惯:日志先脱敏再贴,公司代码不进对话,敏感仓库直接隔离;企业侧还有数据防泄漏工具、合规审查、内网部署挡着。程序员把所有东西处理好之后,才打开 AI 工具。
学生没有这套防线,也没人教过。课题的原始数据、没发表的图表和想法、实验室内部的代码、甚至还没成形的草稿——全量扔进对话框;用 AI 编程工具的话,工具进了仓库就是全仓索引,一次授权、整仓上传,中间没有任何一步停下来问「这段该不该出门」。
把这两个人群放在一起,厂商的处境就看得非常清楚:企业的数据有守门人,拿不到;学生手里的数据没守门人,而且品质更高。企业语料是加工过的成品——脱敏的、切片的、过了合规的;学生语料是裸奔的毛坯——未成形的假设、未清洗的数据、未发表的失败记录。而按第二层的账,毛坯恰恰比成品值钱:成品是终态,毛坯带全过程。
「鸡贼」的精确形状就在这里:福利精准地发给了防御最弱、数据最生的那群人。免费额度买到的不只是谱,是没人脱敏过的谱。更麻烦的一层在后面——学生上传的未必只属于自己的:课题组的未公开数据、导师的内部材料,常常也在「什么都扔给 AI」的半径里。这不是学生的道德问题,是没人告诉过他们边界在哪。
程序员把所有东西弄好之后再打开工具;学生打开工具之后,把所有东西都弄了上去。同一款产品,两种用法,厂商只对学生免单。
四、数据下放:谱越采越早#
把镜头拉回校园,这条线就跟上了之前反复拆过的那个现象:本科阶段的研究生化。竞赛从大一开打,课题从大二进组,「让本科生做回本科生」的呼吁之所以到处流传,恰恰因为它反对的事正在成为默认设置——本科四年被塞进了原本属于研究生阶段的科研训练。这条路上游甚至更夸张:竞赛论文的代理人战争早已前置到中学(课题组金字塔一篇拆过账)。
站在收谱一方看,这个趋势的味道是甜的:采谱的年龄段在整体下移。过程数据以前主要从研究生身上采——现在本科一二年级就带着真课题进来了。数据来源的口径更宽、年限更长:一个用户从十八岁开始下谱,能一直下到博士毕业,十年跨度、全程真实。而且成果压力前置意味着试错前置——压力越早、失败越密、反馈越值钱(第二节的账在这里再记一遍)。
再算最后一层经济账,也是最冷酷的一层:免费计划的绝大多数用量是噪声。拿来刷作业、编闲话、生成没人看的东西——这些调用是纯成本,一分钱谱都换不回来。但采谱生意的回本结构是幂律的:一万个白嫖者里,只要有几十条真正在做课题、真在给反馈的优质轨迹,就足以覆盖全盘成本——因为那种数据在市场上根本买不到(第二节论证过的稀缺性,在这里变成定价权)。免费面铺得越大,漏斗底部捞到金谱的期望值越高;设置门槛会筛掉噪声,但也会漏掉天才——而天才的谱,一条顶一万条。
这就是整套生意的完整形状:用全量免费摊薄风险,用幂律回收筹码,用下放扩宽矿脉。学生个体「越早入局」在博弈上未必吃亏——但最好清楚,自己十八岁递出去的第一份课题,进了谁的数据库。
五、围棋的类比:越新越强,与神之一手#
有一个运动,人类的表现严格随时间变强:围棋。原因简单得残忍——棋谱是累积的。
古代国手终其一生能打到的谱,可能不如今天一个业余爱好者一个晚上的量。黄龙士看不到吴清源的棋,吴清源看不到 AlphaGo 的棋,而现在的孩子开局就在背 AI 定式。2016 年之后这个循环又拧了一圈:AI 重塑了开局理论——点三三从「吃亏」变成常识,早肩冲从异端变成教材——新一代棋手站在 AI 的对局记录上长大,整体又强过前一代。每一代人都踩着全部前人的谱,所以每一代都比上一代强。
大模型正在被塞进同一条轨道:用的人越多、反馈越真,模型见过的「对局」越多。厂商的话术是「越用越聪明」,翻译过来就是——用户在下谱,模型在长棋力。
而这条轨道的终点,围棋给过一个精确到日期的示范。2016 年 3 月 10 日,AlphaGo 对李世乭第二局,黑棋第 37 手:早早五路线肩冲。AlphaGo 自己的局面评估里,这个点的出现概率是万分之一——人类的顶级棋手几乎不会考虑那里。解说席当场懵住,初判是失误,深夜复盘才改口称之为好手;李世乭赛后离场独坐了二十多分钟。后来这一手被称为「神之一手」(对局记录 ↗)。
那一手最要紧的属性是:它不在任何人类棋谱里。它来自数百万局自我对弈之后,从分布的尾部捞出来的一个点。人类几千年的对局记录里没有它——不是因为它错,而是因为人类的谱还没累积到那里。
把这个标准平移到大模型上:LLM 的「神之一手」应该长什么样?大概是模型面对一个真实课题时,提出一个领域专家直觉上觉得离经叛道、实验一跑却成立的假设——不是检索,不是缝合,是那一手五五肩冲。
现在的模型到这一步了吗?今年的成绩单,可以一页一页翻。
六、成绩单:谱还在半路#
第一页:四跑三败,六种死法。 一项年初的端到端实验,让六个 LLM 智能体串成完整科研流水线,从想法到实验到成文,连跑四次:三次死在半路——实现阶段崩掉或评估不过关——唯一走完的一条,被一个试验性的「AI 一作」会场接收(Trehan & Chopra, 2026 ↗)。作者归纳的六种死法值得全文照录:向训练数据默认值偏置;执行压力下的实现漂移——方案在跑的过程中悄悄变形;长任务里的记忆与上下文退化;过度兴奋——在明显失败时宣布成功;领域智力不足;实验设计缺乏科学品味。
六条里最值得展开的是「过度兴奋」,因为它不是孤例。另一项著名实验里,开发者的自我感知与实测差出四十个百分点:事前预期快 24%,事后自认快 20%,实测慢 19%(METR,2025;详见学历畸变一篇的引注)。「模型觉得行了」和「真的行了」之间的系统性落差,在写代码和做科研两个战场上都被复现了——而一个连自己赢没赢都判断不准的棋手,下不出神之一手。
第二页:二十项任务,四胜十六负。 AIRS-Bench ↗(2026-02)从最新的机器学习论文里抽出二十道不给基线代码的任务,覆盖语言建模、数学、生物信息、时间序列,考的是全生命周期——想法生成、实验分析、迭代改进——而不是跑通给定脚本。前沿模型配上串行、并行两套智能体脚手架去打:二十项里只有四项超过人类最好成绩,十六项没追上;而且赢了的那四项,也没有摸到任务的理论上限。赢在会做的题上,且赢得不彻底。
第三页:会描述,不会机制。 SDABench ↗(2026-07)把科学分析拆成六种能力——描述、探索、推断、预测、因果、机制——跨生物、化学、环境、地理、物理五个领域,用 527 个真实数据实例加 6000 个合成实例测了 15 个模型。结论一句话:描述性分析做得像模像样,一到假设选择、潜过程建模、机制推理就急剧退化。它的五阶段误差定位更细:越强的模型越能找对问题的范围和变量,然后死在三步——选不对分析方法、建不对变量关系、下不了有效结论。翻译成棋话:定式背得熟,中盘算不清。
三条线之外还有一个注脚:Sakana 的 AI Scientist 系统,2025 年生成出第一篇通过同行评审的 AI 论文(一个实验性 workshop),2026 年 3 月系统本身登上了 Nature——AI 一边下谱,一边把自己的谱投给评审。热度是真实的,《麻省理工科技评论》今年四月把「人工科学家」列进 AI 十件要紧事(专题 ↗);实力差距也是真实的。两件事同时成立。
把这些放回围棋的坐标系:模型会复盘、会打谱、会复述定式,但还没下出过自己的第 37 手。收谱的生意,还没收够。
七、考场对照:数模竞赛的三十分钟#
成绩单上那种狼狈,在另一个赛场上完全看不到——全国大学生数学建模竞赛,三人一队、72 小时交一篇规范论文的本科赛事。
规则层面 AI 已正式放行。2026 年试行《人工智能工具使用规定》 ↗:参赛队可使用大模型、生成式 AI、代码辅助工具乃至 AI 智能体,条件是参考文献前附「AI 工具使用声明」、核心建模由队伍主导、AI 参与内容逐项人工审查;各家数模赛事(如 MathorCup ↗)相继跟进。条款写得细,但「队伍主导」的核查全凭自律——三十分钟级工具链面前,红线主要约束诚实的人。
然后是完成时间。B 站上已经有一批视频,标题直白:三十分钟做完今年的数模题。有人免费分享全流程,有人做成付费内容。这不算吹牛——开源侧已有现成的完整流水线(如 MathModelAgent ↗:题目分析、模型建立、代码执行、图表生成、论文交付一条龙),顶级模型配上配置好的工具链,半小时量级出全部题解是工程事实,不是魔术。差距在最后一公里:题解只是及格线,一篇能交的论文还要求参考文献逐条真实可查、排版贴合组委会模板。这段恰好是工具链的地盘——以日常在用的开源 Agent 发行版 Linxira Zeta ↗(OMP 内核、走 MCP 协议挂载工具)为例,长期使用并打开 memory 之后,它会记住历次交稿养成的排版习惯:论文走 Markdown 加 LaTeX 转 PDF,还是 HTML 转 docx,摘要页怎么排、公式编号怎么对——下次开题,格式这条轴不再占用心力。
灰色地带比考场更快。代做是数模的老产业,如今是「人工加 AI」的论文工厂提速版:稳妥起见,题目发布的那一刻下单,一个小时就能拿到货。这不是传闻——全国组委会 2025 年的评阅通报 ↗点名「部分送全国评阅的普通院校参赛论文存在严重违纪现象」,评阅专家发现大量内容雷同(数模竞赛〔2025〕5 号);各校的违规处理通报也年年都有。
最快的那批人还有第三种变现:开赛一小时完赛,剩下的七十一小时开直播讲课。买课的听课;买「套餐」的直接拿结果;还有一类要看完视频才知道结果——付费墙本身成了答案的包装。72 小时的比赛,被压缩成 1 小时生产、71 小时销售。
为什么同一个模型在数模考场三十分钟满分、进了实验室就四跑三败?对照就藏在这两节之间:数模竞赛是有裁判的封闭考场——题目封闭、答案可验、交付格式标准化,这是围棋的结构;真实科研没有裁判,这才是它难的结构。能力边界不在模型身上,在考场的规则书里。
顺带把这条线接回主账本:数模赛场是矿脉上最富的一段——72 小时高压、目标明确、交付完整,一个参赛队的完赛轨迹就是一局高质量的谱。而围绕考场的整条产业——工厂、卖课、直播——每个环节都在生产新的过程数据;那纸「内容雷同」的通报还提示了矿脉的成色分布:雷同集中在普通院校,批量复制的谱,采进去也是噪声。竞赛允许 AI、厂商免费送 AI、学生必须用 AI——三条线在这里合流。
八、为什么必须是真的课题、真的失败#
一个自然的疑问:何必费劲收人类的谱?让模型自我对弈不就行了——围棋就是这么成的。
答案藏在两种游戏的规则书里。围棋有零成本的完美裁判:规则封闭,落子即验,胜负毫厘不爽,一局对弈从开始到判定不需要任何外部世界参与。科研没有这个裁判。一个假设对不对,要湿实验、要同行评审、要时间——验证回路又贵又慢,还常常错判。让模型自评科研,等于让棋手自己宣布自己赢了;而「过度兴奋」那一条死法证明,它真的会这么干。
合成数据走不通、自我对弈走不通,唯一剩下的裁判是人类研究者本人——用真实的成功与失败当反馈信号。于是采谱网络必须建在人身上,而且要建在裁判密度最高的人群上:课题真、周期短、反馈狠、没有表演动机。学生是这个描述的精确画像。
这也顺手解释了另一个现象:为什么各家对学生计划的宣传里,「学习助手」「论文阅读」「作业辅导」是主打场景——这些恰恰是反馈最密集的用法。每一次「这个答案不对」「这个引用是编的」「换个思路」,都是一次免费的裁判判决。
九、结尾:第 78 手在哪边#
闭环至此完整:厂商需要棋谱→学生需要额度→额度换来过程数据→数据喂养下一代模型→下一代模型离神之一手近一步。闭环里唯一没写进合同的是:当第 37 手真的出现时,谱的归属——训练数据里的那些过程,法律意义上早已不是你的了。
所以给学生这边的结论要写得诚实:免费额度是真实的好工具,用,往死里用。但要清楚自己在这盘棋里的位置——你打的是模型的谱,也在被模型打谱。用它攒自己的课题、自己的交付、自己的判断力,那叫借力;只用它省自己的事、替自己的脑子,那叫入谱。
围棋那边其实把结局也演完了,而且比想象中体面。AlphaGo 横扫之后,人类棋手没有消失:2016 年 3 月 13 日第四局,轮到李世乭下出第 78 手——一记挖,AlphaGo 局面评估当场崩盘,人类扳回一局。那一手后来也叫「神之一手」,而它出现的位置很讲究:在被 AI 喂了三千年的棋谱之外,由一个被 AI 击败过的人类下出。
厂商在等模型的那一手。你会等出自己的哪一手,合同里没写,谱上也没有——那部分还是你的。
附#
- 学生免费计划实例:Google AI Pro 学生免费一年(TechRepublic) ↗、Gemini 学习中心(Mashable) ↗、GitHub 学生包与 Copilot(说明页) ↗;各家具体条款随时变动,以官方页为准
- 自主科研:Trehan & Chopra, arXiv:2601.03315 ↗(四跑三败、六种失败模式)
- 基准:AIRS-Bench, arXiv:2602.06855 ↗(二十项、四胜十六负、胜项未达理论上限);SDABench, arXiv:2607.11079 ↗(六能力×五领域、五阶段误差定位)
- METR 开发者感知-实测差(预期 +24% / 实测 −19%):出处见10-02 一篇附注
- AI Scientist 时间线:首篇过审公告 ↗、登 Nature 公告 ↗;MIT Technology Review「Artificial scientists」专题 ↗
- AlphaGo 第 37 手(2016-03-10,第二局,自评概率约万分之一)与李世乭第 78 手(2016-03-13,第四局):对局记录 ↗
- 国内:豆包学生认证 2.5 倍额度与 38 元/月(新浪科技) ↗、Qoder CN 学生专享(阿里云大学计划) ↗、TRAE 与扣子并入豆包体系(21 财经) ↗
- 数模竞赛:国赛 2026 年 AI 使用规定(官方 PDF) ↗、MathorCup AI 规定 ↗、2025 年评阅违纪通报(官方 PDF) ↗、开源流水线 MathModelAgent ↗
- B 站三十分钟完赛视频、赛中直播卖课与套餐分级(买课/直接给结果/看视频给结果)为平台现象的观察性叙述,未逐条核对具体 UP 主与商品
- 「学生不脱敏」一节的现象描述为通行的使用观察,未附单一出处;「毛坯比成品值钱」承接第二节的框架推演
- 「过程数据买不到、只能现场采」与「负样本最贵」为本文分析框架,非文献引用;软件时代教育策略为通史性叙述,未附单一出处