又看到有人做”AI 测试”了:挑五道专业课真题丢进网页对话框,回来对了三道半,于是下结论——“所谓大模型,专业水平堪堪及格,数学更是一塌糊涂,大家别神化。”

评论区一片附和。但我盯着这条帖子看了很久,因为它从头到尾建立在一个错误的预设上:他在考一个不许打草稿的学生。

一、先分清两种模式:chatbox 和 Agent

今天大部分关于”AI 强不强”的争吵,参与者连自己在用什么模式都没分清。

chatbox 模式,就是那个最熟悉的输入框:你打一句话,模型回一段话。中间没有工具、没有执行环境,模型是”裸”的——它只能靠参数里记住的东西直接开口。网页版默认是这样,很多手机 App 也是这样,甚至不少”桌面客户端”也是这样。顺带补一个很多人一直没搞清的概念:相当一部分桌面 AI 应用,本质就是浏览器内核套了个壳,和你开的网页标签没有代差。判断一个产品处在什么模式,不看它的窗口长什么样、要不要下载安装,只看它背后给模型接了什么能力

Agent 模式,则是给这个”裸模型”配上了手和脚。它能做的事情至少多了三样:

  1. 打草稿做计算——写一段代码,真的跑起来,看着输出说话;
  2. 编写文件——把中间结果、最终交付物落成真实的文件,而不是全挤在聊天记录里;
  3. 深度搜索——这个下面单独讲,因为它和 chatbox 的”联网”完全是两回事。
能力 chatbox 模式 Agent 模式
算数学 心算,靠训练时背下的套路 写代码真算,报错自己改
中间过程 全挤在对话上下文里,长了就丢 写成文件落盘,跨步骤保留现场
联网方式 调一个搜索接口,拿回几条摘要 爬虫、带参数抓取、多路混合,读原文交叉验证
交付物 一段文字 真实的文件:文档、表格、代码、图表
出错之后 等你来发现 看得到报错,自己重试

重点说说第三条,搜索的差距最容易被低估。chatbox 的”联网搜索”,本质是调一个传统搜索服务的接口,拿回几张摘要卡片,模型基于摘要作答——像你问旁边人一件事,他说”我刚百度了一下,大概是这么回事”。Agent 的搜索是另一个物种:它拿到问题后会自己拆解需要什么信息,构造检索词,甚至带上参数去抓——按时间过滤、翻页、定向到某个站点;拿回来的不是摘要,是原始页面,它会点进去读全文,多个来源交叉比对,一条路走不通就换一条,爬虫、接口、文档各显神通。一个是听人转述,一个是派研究员出去查资料。

所以回到开头那个”测试”:用裸 chatbox 去考 AI 专业题,然后宣布 AI 不行——这个结论的适用范围,仅限于”裸 chatbox”。

顺带拆掉另一个流行误区:“CLI agent 一定比桌面/网页强。” 这话就像”锤子一定比螺丝刀好”。快问快答,chatbox 门槛最低;改自己的代码库,CLI 贴着真实项目干活;要一个干净的执行环境跑任务,云电脑最合适。形态没有高下,匹配任务才有高下。真正的分水岭从来不是壳,而是——模型有没有地方打草稿。

二、”AI 数学差”,多半是被心算坑的

先说一个反直觉的事实:大模型算不对多位数乘法,不是因为它”笨”,而是它的底层机制决定了它天生是个心算选手。

语言模型的本质是预测下一个词。你问它 3847 × 2763,它是逐位”猜”出答案的——每猜一位都可能出错,中间没有任何进位记录可查。这好比要求一个人心算四位数乘法还不许列竖式:工作记忆里要同时攥着七次部分积和它们的位置,出错几乎是必然的。

人类早就解决了这个问题。竖式的本质是什么?外部化记忆。 把中间结果写在纸上,大脑只负责执行单步规则。会竖式的小学生能算十位数乘法,不会竖式的数学家心算照样翻车。

所以当你在裸 chatbox 里让 AI 做数学题时,你就是在禁止它列竖式。而换成 Agent 模式,让它写段代码:

1
2
>>> 3847 * 2763
10629261

一步都不会错。再复杂点,解方程、算积分、拟合数据,让它调 sympy、numpy 真跑一遍,和”纯想”完全是两个物种。这不是 AI 突然变聪明了,是你终于给了它草稿纸。

有人会问:现在的推理模型不是会”深度思考”吗?确实,思维链本质上就是模型在内部给自己划的草稿区。但这块草稿纸有两个硬伤:空间有限,而且上面写的字没人保证对。让它真的执行代码、看到真实的报错和真实的输出,永远比它在想象中演算可靠。这就是为什么”带代码执行”和”裸模型”在各家评测里的成绩经常差出一个档次。

“AI 数学差”这个流传甚广的结论,准确的表述应该是:AI 在不许打草稿的时候数学差。 这句话对人同样成立。

三、”AI 没知识”:它只是拿着一本有缺页的旧教材

专业课题目答错的另一半原因,出在训练数据上。两个机制:

知识有截止日期。 模型的知识冻结在训练完成那一刻。那之后发表的论文、更新的指南、新版本的库,它一概不知。你拿今年的新题考它,它只能按旧知识硬答。

冷门领域天然稀疏。 训练语料来自互联网,而互联网上的内容分布极度不均。热门学科有无数讲义、题解、论坛讨论;某些小众方向,全网资料可能就几十份。数据少,学到的细节就模糊,还可能带着源头本身的偏差和遗漏。

两条叠加的效果是:模型像一个读了海量书、但教材版本偏旧、个别章节缺页的人。旧教材里有的,他对答如流;缺页的部分,他开始编——而且编得一本正经。因为语言模型的本职工作是”补全最像样的文本”,不是”查证之后再开口”。这就是幻觉的来源:它不是在骗你,它是在填空。

理解了这一点,应对方式就清楚了:别考他的记忆,给他递材料。 上传文献让他读着答、开联网让他现查、把资料库接到他手边。同一个模型,喂不喂资料,答题质量天壤之别。这也是我一直觉得聊天框里最被低估的按钮是”搜索”的原因——它一键把闭卷考试切换成了开卷考试。

四、厂商已经把答案写在脸上了

如果说前几年”给 AI 配草稿纸”还是极客的手工活,那最近这段时间,头部厂商在做的事情就是把它变成默认设置。

OpenAI 这几天把 Codex 正式并进了 ChatGPT 桌面应用:现在打开桌面端,有三个模式——Chat(快速问答)、Work(长任务代理)、Codex(写代码),原来独立的 Codex 应用变成了桌面应用里的一个视图。两个细节值得注意:其一,Work 在网页端直接跑在云端,官方说法是”云任务运行在 OpenAI 托管的环境里”——翻译一下,给你在云上开了一台电脑,一个预装好环境的 Linux 沙箱,AI 在里面写脚本、运行、看报错、修改、再跑;其二,Codex 已包含在所有套餐里,包括免费版

国内的格局更能说明问题,因为它提供了一个完美的反例。DeepSeek 的网页端,到今天仍然只有多轮搜索,没有真正的 Agent 模式——尽管它家模型的推理能力有口皆碑。这就是”能力”和”形态”分离的活体标本:模型分数再高,产品只递给你一个对话框,你就享受不到它的真实水平。

而其他家几乎都在往 Agent 方向押注:阿里的千问系列把 Agent 做成了标配;百度——即便它家模型的能力常年被吐槽——也照样把 Agent 功能端上了台面;Kimi 更是去年就在网页端免费送云电脑,让每个用户都能派任务给一台云端虚拟机。豆包同样,哪怕免费用户,也能体验给 AI 一台云端电脑:一个 Linux 容器环境,AI 在里面实际编写并运行 Python 脚本,多步搜索、多步执行,跑完把结果端上来。

转折点是今年年初。开源圈那只”龙虾”(OpenClaw)爆火,无数普通人第一次亲眼看到:一个跑在完整 Linux 环境里的 Agent,能自己装依赖、写代码、执行、交付,和对话框里的”文字接龙”根本不是同一个物种。那波热度之后,国内厂商几乎集体跟进,把 Linux 云环境做成了产品标配。

把这些动作放在一起看——海外,OpenAI 把云电脑塞进了免费套餐;国内,从头部到口碑垫底的厂商都在上 Agent 和 Linux 环境;开源社区干脆把整套东西送进千家万户——方向已经写得非常直白:模型能力的竞争,正在变成执行环境的竞争。 光有脑子不够,得有手。

连竞赛的记分牌都换了。这两年各家发新模型,发布页上晒的是 SWE-bench 这类编码基准、Agent 任务基准的成绩——“会用工具””能扛长任务””能自己修 bug”成了第一卖点;几乎没有人再拿”文笔更好”当核心升级点。原因就是本文一直在说的那件事:给模型配上工具,它能发挥的能力远超裸考。 既然如此,训练和评测自然全部押向”用工具的状态”;纯文本写作这种”裸考科目”,反而成了不太被加码的副科——不是写作不重要,是大家都想明白了一件事:工具带来的增益,比堆参数大得多。

这里藏着这一轮竞争里最深刻的一条分界线:模型能力和产品形态,是两条独立的轴。 DeepSeek 是”高分模型 × 保守形态”,你用它时,等于看着一个学霸被绑在最低配的工作台上干活;反过来,一个模型平平的产品配上激进的形态,完成度可能超过裸的强模型。你真正的体验,近似于这两个坐标的乘积——只盯着模型跑分选产品,和只看 CPU 主频买电脑一样,是上个时代的思路。

这个道理解释了一个很多人没想通的现象:为什么模型更强的 DeepSeek 常年被抱怨”不好用”,而豆包却好评如潮。 不是豆包的模型更强——是装备不同。豆包给 AI 配了云电脑、配了能跑代码写文件的手;DeepSeek 递给你的,是一个绝顶聪明但两袖清风的对话框。同一个学霸,一个给他实验室,一个只给他一张嘴,产出的差距自然远大于模型本身的差距。用户嘴里的”好不好用”,排的从来不是模型分的榜,而是装备的榜。

当”写代码→运行→看报错→修改→再跑”成为产品的默认行为,”AI 数学好不好””AI 有没有知识”这类争论会自动降级——因为绝大多数场景下,它不再需要靠记忆答题,它可以去查、去算、去做实验。到那时真正拉开差距的,只剩一个变量:你会不会用。

五、神灯,与老领导

最后聊心态,因为工具的问题好解决,心态的问题难缠得多。

神灯心态。 相当一部分人对 AI 的期待是:摩擦一下,许愿,马上出结果。一句话扔进去,完美答案吐出来;如果 AI 反问了一句”你要什么格式”、多花了两分钟、或者要求补充信息——体验分立刻不及格。这套预期里,AI 是道具,不是协作者。

老领导心态。 另一些人反过来,把 AI 当成必须接受考核的下属:”我问什么你就得答什么,答不上来就是你没能力。”有意思的是,持这种心态的人,往往正是那些不愿花二十分钟了解 AI 到底是什么的人——他们用来考核 AI 的那套标准(闭卷、口算、秒答、全知),放在任何一个人类新员工身上,都会被判为荒谬。

而正确的姿势,其实和带一个聪明但不了解你情况的同事差不多:

  • 交代背景:你是谁、要什么、约束是什么、给谁看;
  • 允许多轮:第一次产出不满意是常态,追问和修正本来就是流程的一部分;
  • 主动给工具:要算数就让它写代码,要新信息就让它搜,要交付物就让它真去生成文件;
  • 大任务拆着走:先框架后细节,每步验收,而不是一句话甩过去等奇迹。

六、下次说”AI 不行”之前,先过一遍这张清单

  1. 这道题需要打草稿吗?需要的话,我是让它写代码跑了,还是让它干瞪眼想?
  2. 我问的东西超出它的知识截止日期了吗?开搜索了吗?
  3. 这是不是冷门专业内容?我喂参考材料了吗?
  4. 我的提示里,背景和约束给够了吗?
  5. 我选对模式了吗?——快问快答用 chatbox;动自己的代码库用 CLI;要干净的执行环境跑任务,用云电脑。

写在最后

AI 不是神灯,也不是全知全能的教授。它是一个读过整个互联网、但知识有保质期、不会算数——除非你递给它纸笔——的同事。

过去这两年,厂商们做的事情概括起来就一件:拼命给这个同事配电脑、配网络、配软件。当这一切已经免费摆在你面前时,如果你还在用一个裸对话框去”考”它,然后拿着一场闭卷口算的成绩宣布它无能——

那么首先被淘汰的,不会是它。