别再问哪个 Agent 最强——它们连活法都不一样
别再问哪个 Agent 最强——它们连活法都不一样
过去一个月我被问得最多的问题就是:”哪个 Agent 最强?”
这个问题没法回答,因为它预设了一个不存在的前提:所有 Agent 在赛同一条赛道。事实是,我把 47 个 Agent 摆在一起、逐个翻完 README 之后,发现它们连”活着的方式”都不一样——有的把一切交还给你,有的替你焊死所有流程,有的在你睡觉时偷偷学习你,有的干脆把自己拆成一堆可替换的零件,还有的压根不卖 Agent,卖的是它背后那朵云。
用”强弱”去比它们,就像用百米成绩去比较潜水员和登山运动员。
有一个数据能说明框架比模型更决定结果:同一个模型,换一个框架跑,表现能差 5–40 个百分点(Claude Opus 在 Claude Code 里 77 分,在 Cursor 里 93 分)。模型是灵魂,框架是身体——灵魂再好,装错身体也跑不动。
所以我做了一个自测网页:处境题加认知题,分三档深度——极速 20 题(处境+认知)三分钟出结果;详细 70 题在处境之外加需求、展望两个维度;专业 180 题把认知扩到 12 个维度,给从业者和重度玩家。答完给你推荐几个值得先试的,而不是一个”冠军”。拿不准的题可以标记,答完会建议你升级到更细的版本。这篇文章是它的说明书——讲清楚这 36 个东西到底分几类,每一类的设计哲学是什么,README 里是怎么自我介绍的,以及为什么你该选哪一类。
一、五种活法
分类的轴只有两条:上下文归谁管,以及进化靠谁推动。按这两条切下去,47 个 Agent 落进五个格子。
活法一:极简派——把一切交还给你
代表:Pi、Oh My Pi(OMP)、Zeta
Pi 的 README 把自己的结构摊开给你看,它不是”一个工具”,是四个包组成的工具箱:pi-ai(统一多 provider 的 LLM API,OpenAI、Anthropic、Google 都走同一套接口)、pi-agent-core(带工具调用与状态管理的运行时)、pi-coding-agent(交互式 CLI)、pi-tui(差分渲染的终端 UI 库)。四个包各干各的,没有一层是替你做决定的。
它的设计哲学只有一句话:模型已经被强化学习训练透了,天生知道怎么当编码 Agent,框架不需要过度指导。 所以系统提示加工具定义不到 1000 token,默认工具只有四个——读、写、改、跑。作者甚至有个更激进的主张:与其堆玩具基准,不如公开真实工作会话——他把自己用 Pi 干活的完整会话数据定期发布到 Hugging Face,理由是”公开的 OSS 会话数据,能帮编码 Agent 从真实任务、真实工具调用、真实的失败与修复中改进,而不是玩具基准”。
这条线的代价也直白:它不替你兜底。你给什么上下文,它就基于什么干活;你验收不了结果,它就让你在错误的方向上跑得飞快。
OMP 在这条线上往前走了一步——工程能力不输 Claude Code,而且专门适配了各家的缓存优化策略,对开源模型十分友好。我的 Zeta 再往前一步:给 OMP 补上桌面应用,同时增强记忆和 plan 模式,加入 team agent 能力。
适合谁:能自己验收、想完全掌控上下文的人。
活法二:成品派——框架焊死,替你兜底
代表:Claude Code、Codex、Cursor
Claude Code 的官方定位是”Work with Claude directly in your codebase. Build, debug, and ship from your terminal, IDE, Slack, web, and more.”——注意这个清单,它的野心从来不只是终端。它的可用形态几乎是一张全家桶:终端 CLI、桌面应用(Max/Pro/Team/Enterprise 可用)、VS Code 与 JetBrains 的原生扩展、浏览器端的 claude.ai/code、iOS 和 Android 客户端,甚至可以在 Slack 里直接发起编码任务。
看它的功能列表就知道”成品”是什么意思:
- Dynamic Workflows:把最难的任务拆给 10 到 100 个并行 subagent 同时干,交付之前自己先检查一遍——“checking its work before anything reaches you”;
- Routines:配置一次,按计划、API 调用或事件触发运行——每周依赖审计这种事可以彻底自动化;
- Computer use:直接打开你的应用、操作浏览器、跑开发工具来完成任务;
- agentic search:几秒内对整个代码库建立地图并解释结构,不需要你手动挑上下文文件。
Notion 联合创始人 Simon Last 那句话说得更直白:”我现在工作的很大一部分,就是让尽可能多的 Claude Code 实例忙起来。”——一个人管一支 Agent 车队,这是成品派的终局形态。
Codex CLI 走的是同一条路,README 原话是”Lightweight coding agent that runs in your terminal”,本地运行、Rust 编写,代码模式强制链接带沙箱支持的 V8 构建——安全隔离是焊在工程里的。它还有个细节值得注意:装好后可以 codex app 拉起桌面版,VS Code、Cursor、Windsurf 也都有官方扩展。
成品派的代价也在这:你不知道它替你做了什么,而且 Token 消耗非常恐怖。 Claude Code 服务商适配不好时,随机偏移码等机制会严重打崩缓存命中,成本以你看不见的方式暴涨。
适合谁:想开箱即用、不想折腾配置的人——以及需要内置管理流程兜底的初学者。
活法三:自进化派——它自己学习你
代表:OpenClaw、Hermes、小米 MiMo Code
这是最迷人也是代价最重的一类。它们的共同信念是:与其指望用户写好配置文件,不如让 Agent 自己长出对用户的理解。
小米 MiMo Code 的 README 标题就是态度——“MiMo Code: Where Models and Agents Co-Evolve”(模型与智能体共同进化)。官方自述是”终端原生的 AI 编码助手……通过持久记忆系统跨会话保持对项目的深入理解,同时持续自我改进”。它是 OpenCode 的 fork,保留全部核心能力(多 provider、TUI、LSP、MCP、插件)之后,新增了一整套自我改进机制。最有意思的是两个命令的官方定义:
/dream— 扫描近期会话轨迹,将持久性知识提取进项目记忆,并清理过时条目。/distill— 发现近期工作中重复的手动流程,将高置信度候选打包为可复用的 skills、subagents 或 commands。
翻译成人话:在你睡觉的时候,它把今天踩过的坑总结成经验,下次不再踩;把你手动重复过好几遍的流程,固化成一条可以随时调用的技能。 这就是圈子里说的”做梦”。它的记忆系统也不是一个文件,是四层:MEMORY.md 存项目知识与架构决策、checkpoint.md 由专门的子代理自动维护状态快照、notes.md 是它的草稿纸、每个任务还有独立的进度日志——全部走 SQLite 全文检索,重启终端不丢。
还有一个设计值得所有做 Agent 的人看一眼:它的 /goal 命令设定停止条件之后,Agent 想停下来时,由一个独立的评判模型来评估条件是否真正满足——防止自主工作里最常见的”过早乐观停止”。这个机制直接回应了 Agent 最经典的三种翻车:一步到位、过早宣布胜利、没测试就标记完成。
OpenClaw 和 Hermes 是这条线上的两个海外代表,而且有意思的是,它们是同一个概念的两条实现路线:OpenClaw 把学到的东西沉淀为 skills,Hermes 沉淀为流程。Hermes 用 Python 实现,比 TypeScript 写的 OpenClaw 性能好一些,官方还有订阅套餐,相当于直接给你 API,不用自己折腾 provider。
但自进化派有一个没人替你付的隐藏成本——磨合期。OpenClaw 和 Hermes 都至少要磨合 6 个月,而且它要拿到你相当隐私的信息才能建立对你的认知。所以这一类更适合本地部署小模型来跑。
适合谁:愿意磨合半年、愿意交出数据、追求长期回报的人。
活法四:开放底座派——一切皆插件
代表:DeepSeek Harness(dsh)
dsh 是 2026 年 8 月 13 日才开源的新物种,几天内 star 破 14 万。它和前面所有的根本区别在于:它自己什么都不是。
它的地基 Cordis 是个微内核,”几乎什么都不干”——只负责插件的加载、卸载和依赖管理。模型适配器、工具注册表、沙箱、调度逻辑,连 Agent 循环本身,都是平级插件。公式是 Model + Harness = Agent,换整个编排循环只需要改一个配置文件。
它内置四种模式,覆盖四种完全不同的用法:标准模式(全工具集,日常干活)、PTC 模式(模型不逐次调用工具,而是写一段代码来编排多轮工具调用,减少往返、提高可靠性)、极简模式(只留 shell 和文件编辑两个工具,专门用来给模型跑基准)、创造模式(检查当前运行时、在内存里试插件、组合出新模式——相当于让 Agent 自己造自己)。
它还有追记式会话日志:模型看到的一切都记录在案,包括每一次上下文注入,恢复、分叉、检索、回放共享同一份事件流。社区插件生态(dsh-plugin 标签)发布半个多月就接近 300 个。
但开放是有代价的,而且这个代价藏在架构里:插件有可能把 agent 的循环打坏。 一个装得不好的插件可以让你重装都没用(可能卡在插件缓存里)。对比之下,Pi 没有完全开放底层 loop,反而不容易被插件干坏。
这就是可插拔度的双刃剑:焊死给你稳定,拆开给你随时可换的出路。
适合谁:有技术能力、想研究 Agent 内部构造、或者想给团队搭底座的人。开发者预览版,别上生产。
活法五:生态派——卖的是入口,不是 Agent
代表:字节 Trae、腾讯 WorkBuddy、豆包工作
这一类最容易被低估,因为单看工程能力它们都不算优秀。但它们卖的从来不是工程能力。
Trae 的价值是”使用面最广”:适配字节生态非常优秀,云端服务器可以快速配置,一并打通火山引擎的所有内容;插件生态非常丰富,支持配置其他家模型,自家套餐也有性价比。腾讯 WorkBuddy 则完美打通腾讯云的组件,能自己总结 skills、有自己的记忆,也有一定自进化能力。
连豆包工作都在做同一件事:把扣子的多模态能力和 Trae 的代码能力缝进同一个入口。当你选这一类时,你选的其实不是 Agent,是它背后那朵云。
这个判断没有对错——如果你的生产环境就在火山引擎或腾讯云上,生态打通省下的时间远超工程能力差距带来的损失。阿里的 Qoder 甚至走出了一条差异化的子路线:工程能力不出众,但 Wiki 和记忆能力在 IDE 类别里非常少见——你可以用它自己的 agent 把整个陌生仓库的 Wiki 写得非常详细,这本身就是一种自进化。
适合谁:大众用户,以及深度绑定对应云生态的团队。
二、两个横切所有类别的维度
上面五类是纵向的,还有两个维度横切它们,选型时经常比类别本身更关键。
缓存命中率:被忽视的账单杀手
我在极简、自进化、底座三类里都看到同一个词被反复强调,而且都指向同一个事实:AI 永远只在进行一轮对话,每次工具反馈都会触发上下文重读,这时候缓存命中与否直接决定账单。
OMP 专门适配各家缓存优化策略;智谱 Zcode 官方宣称缓存能力极强、命中率高;dsh 把缓存当核心设计;Reasonix 更极端——它的工程能力一塌糊涂,唯一的优点就是缓存优化,因为它是围绕 DeepSeek 的前缀缓存计费模型设计的。
反面教材是 Claude Code:工具本身很强,但服务商适配不好时,缓存命中率被打崩,成本会以一种你看不见的方式暴涨。
这一项应该进入你的选型清单,权重不低于工程能力。 工程差一点顶多多改两轮,缓存崩了是真金白银。
形态要分开评价,不是按产品名选
同一个产品,CLI 版和桌面版经常是两个东西。Cursor 的 CLI 和桌面版差距巨大;Codex CLI 的界面并不优秀,普通用户更适合用客户端;Kilo Code 更多人在用它的 VS Code 插件而非 CLI;GitHub Copilot 该看的是 VS Code 里的插件和 agent 模式,它的 CLI 反而用起来比较混乱。
而选 IDE 形态的理由也不全是技术性的。很多程序员坚持要 IDE,是因为旁边有个对话窗口,沟通更顺,也让老板知道他确实在写代码。这是个社会性需求,不丢人,选型时该算进去。
模型偏好:认准一家,还是随时能换
还有一个维度经常被忽略——你对模型的偏好。这里分成两种活法,而且没有优劣,只看你认不认一家。
生态专用类:锁自家模型,开箱即用。 这些工具深度绑定某一家的模型(提示词、工具链都为它调优过),换来的是省心——装上就能用,套餐通常还靠谱。但代价是被那一家的定价、断供、收购锁死。最吃亏的场景是你们推荐的 agent 很适配国外模型,你却在国内访问不了它家的模型。
代表:Kimi Code(锁自家 K3、国际第一梯队)、Kimi Work(300 agent 协作)、Qwen Code(锁 Qwen)、MiniMax Code(锁 MiniMax)、Grok Build(锁 xAI)、文心快码 Comate(锁文心)、CodeGeeX(锁智谱 GLM)、讯飞星火 Agent(锁星火)、豆包工作(锁豆包,能力上限不高平时白嫖合适)。这类大多官网直装、国内访问顺畅。
开放可配类:随意换任何模型。 代价是多一点配置,换来模型中立——哪家便宜、哪家好用,随时切,不会被单一生态拿捏。工程类代表 OpenCode(开放)、OMP(缓存优化对标 Claude Code)、DeepSeek Harness、Pi、Aider、Amazon Q、OpenHands;办公大众类代表字节 Trae(适配自家也支持配别家)、智谱 Zcode(缓存极强、能配所有模型)、腾讯 WorkBuddy(可配别家)、GitHub Copilot(常规模式可配第三方)。
判断方法:认准一家生态(尤其只想要 K3/Qwen/Grok/HY/豆包这类)就直接用专用类;想随时比价、免被锁定、要能落地到国内可跑的模型,就选开放可配类。 我给”模型偏好”设计成了极速版处境题之一(注意:生态专用和开放可配没有孰优孰劣,只看你的预算和风险偏好)。
三、认知水平决定你能用哪一层
这是我把自测网页做成极速/详细/专业三套的原因。极速 20 题里处境题八道(命令行能力、境外可达性、用途、形态、安装方式、配置意愿、磨合期、模型偏好),认知题十二道;详细 70 题把处境扩到处境+需求+展望三组信号,认知铺开到 50 道;专业 180 题把认知扩到十二个维度(在知识边界、检索接入、记忆上下文、幻觉验证、可用成本、工具框架、自主安全、行业生态之外,增加安装部署、生态锁定、协作验收、评测素养),给从业者和重度玩家。另外每道题都配了提示语,拿不准可以标记,答完会建议你升级到更细的版本。处境问你”卡在哪”,认知决定该给你什么层级——
- 模型 5 月发布、8 月使用,6 月的新内容它知道吗?
- 开了联网搜索,能查到判例库和论文库的全文吗?
- 聊了 20 轮,它真的”记得”前面说过什么吗?
- 它给你的参考文献,你怎么判断真假?
- 同一模型换个框架,表现能差多少?
- 为什么让它多接几轮后续,账单会涨得比预期快?
这些题不是考你,是在给工具分层。认知分低的用户拿到极简派工具,等于把方向盘交给不会开车的人;认知分高的用户被塞一个重编排框架,则是在给赛车装限速器。 同样的工具在不同认知水平的人手里,是两个东西。
如果你认知题几乎全对——训练截止、搜索够不到数据库、上下文每轮重读、引用会编、框架决定结果——那你可以放心去玩极简派和开放底座,它们会把全部判断权还给你。如果答不上来,先别急着挑工具,这些地基补上之后,你看到的推荐名单会是另一份。
四、如果实在不想选:三个通用起点
总有人什么都不想选。给三个通用起点,共同点是都有桌面应用、界面清楚、装上就能用、都能换模型:
- OpenCode——官方定位就一句”the open source AI coding agent”。有桌面应用(BETA),macOS/Windows/Linux 都有安装包。内置 build 和 plan 两个 Agent 用 Tab 键切换:build 是默认的完整权限开发模式;plan 是只读的,默认拒绝改文件、跑命令前会问你权限,专门用于探索陌生代码库。想学 CLI 从它开始。
- 字节 Trae——国内大众用户的默认起点之一。打通火山引擎、插件生态丰富、可配其他家模型。
- 腾讯 WorkBuddy / CodeBuddy——腾讯云用户的默认起点。能自己总结 skills、有自己的记忆,也有自进化能力。
它们不一定是终点。通用起点的意义是让你先跑起来,等你知道自己缺什么了,再回来换。
最后回到开头那个问题:”哪个 Agent 最强?”
现在你可以看出这个问题缺了什么——它没说你是谁、你要干什么、你能验收到什么程度、你愿意付出多少磨合期。自测网页分极速 20 / 详细 70 / 专业 180 三档,答完给你的是”以你的情况值得先试的几个”,而不是一个冠军。
工具一直在升级,但选型的底层逻辑从来不变:先搞清楚你手里的是什么,再搞清楚你是谁。
上一篇讲过:什么时候你发现用 AI 反而更忙了,这一关你才算入门。这一篇的补充是——入门之后,别急着换工具。先确定你站的那一层站对了,再谈往上走。