和AI磨出一篇批判文章:多轮协作写作方法论(文末附可复用Skill)

今天同时发布的那篇词元文章,不是一次成稿的。它从一句带着情绪的语音输入开始,经历了十几轮往返:我发散观点、拍板框架,AI 核查事实、纠正我的错误,我再纠正它的错误,最后磨出一篇带十六条参考文献的批判长文。这个过程本身就是一个相当典型的”AI 辅助写作”实践样本。这篇文章把整个协作过程拆开复盘,提炼成一套可以复用的方法论——文末附上整理好的 Skill,下次写考证型文章可以直接加载。

第一课:先核查,再开火——AI 的第一个贡献是反转了靶子

事情的起点是一句愤怒的语音输入:人民日报说 token 就是词元,事关科技话语权,这文章太蠢了。如果当时顺着情绪直接开写,出来的就是一篇纯泄愤的檄文,而且大概率会打错靶子。

AI 做的第一件事不是写,是查。查完发现了一个关键反转:全国科技名词委 3 月 25 日的公告其实做得很克制——标题写明”人工智能领域”,程序是”发布试用”,还留了”结合社会推广应用情况最终确认”的口子。真正有问题的,是前一天报纸那篇抢跑宣布”中文名定了”的报道,和五个月后把译名问题升格成”话语权危机”的锐评。

这就是协作的第一课:情绪指认的靶子和事实上的靶子,经常不是同一个。人的愤怒指向的是”谁让我不爽”,核查回答的是”到底哪一步出了问题”。把靶子找对,后面的十几轮讨论才没有白费——如果一开始就把名词委当敌人,整篇文章的论证地基就是歪的。

第二课:尺度是用户定的,执行是AI保的

靶子找对之后,轮到用户立规矩。这个环节完全是单向的:用户说,AI 执行。

  • 对事不对人:嘴上可以骂,成文里一个脏字不能有。”领导拍脑袋决策”这种判断,在文章里只能呈现为日期链——23 日论坛发言,24 日报纸宣布”定了”,25 日官方公告写”试用”——让读者自己得出结论。这比一万句指责杀伤力大,因为它无法被反驳。
  • 参考文献前置并分组:矛盾文献(被批评的两篇原文)、事件与制度文献、语言与历史辅佐文献,三组十六条来源,全部放在正文开头,欢迎逐条核对。
  • 关键论断必须原文引用:锐评说什么就引什么,一个字不改。
  • 术语挂命名机构的链接:记号、令牌、代币这些既定译名,全部指向名词委的”术语在线”,读者点进去就能验证。
  • 百科用国内可访问的源:不链维基百科,用百度百科和术语在线;维基本身可以在正文里提一嘴当论据,但不做引用链接。

这些规矩没有一条是 AI 想出来的,全是用户定的。AI 的价值在于把这些尺度执行到每一个段落、每一条引文,并且在自己手滑的时候被揪出来——后面会讲到这种手滑。

第三课:两套纠错系统并联

这次协作里最值钱的机制,是双向纠错。不是”用户审稿、AI 改”,而是两套系统各自抓对方漏掉的东西。

AI 抓用户的事实性错误,抓了三个大的:

  1. 语系谱系。用户说”朝鲜、韩国、日本、缅老越衍生自汉藏语系”——谱系上这是错的。日语、朝鲜语系属有争议,越南语属南亚语系,真正和汉语同属汉藏语系的是缅甸语等藏缅语言;日、朝、越的正确身份是”汉字文化圈”——谱系不同但千年借词。一篇全文讲严谨的文章,自己不能犯语言学的错,所以成文里按准确框架写了,还顺手把柬埔寨、老挝剔掉了,因为它们受汉语词汇影响相对次要,硬塞进去反而给人留话柄。
  2. 词源细节。”加油”进牛津词典是 2018 年,书证追溯到澳门大奖赛;taikonaut 在《牛津英语词典》有正式词条;严复的译词活到今天的只剩”乌托邦””图腾””逻辑”三个——这些数字和年份全部逐一核实过才写进去。
  3. 引用的可得性。用户想引用”工科毕业生搞不定环境配置的调查”(更早那篇提示词文章里),AI 查了半天没有严格对应的调查,建议改写成”连职业程序员都被环境配置折磨”——立得住,不用编。

用户抓 AI 的感受性错误,也抓了三个大的:

  1. 字母计数。AI 在文中写”5G……三个字母更省力”——5G 是两个字符;写”Token 的四个字母”——token 是五个字母。用户一眼扫出来,全部改掉。
  2. 详略失衡。医学那段太短,用户要求把仪器检查展开——拍 X 光要说成”利用某波段的电磁波成像”,CT、核磁、B 超都得亮出全称,才能让人体会到缩约的分量。
  3. 结构缺件。参考文献要分组、要前置,术语要挂机构链接,批判文要叠甲,收尾前要加一条”五立场光谱”把全文论证收拢——这些都是用户拍板补的框架件。

把两张清单放在一起看,分工非常清楚:用户抓 AI 的”感受性错误”——详略、口吻、重点、结构;AI 抓用户的”事实性错误”——数字、谱系、年份、出处。两套系统并联,比任何一套单独开都稳。单一作者最容易犯的错,是事实错误和感受错误一起漏——因为他既是运动员又是裁判。

第四课:发散不设限,收敛有铁律

这次协作的节奏是:用户每轮语音丢进来一批新点子——5G 和 GDP 的双标、全称翻译体段子、代币比词元更信达雅、credits 是记账货币、两岸三地译名差异、台湾政论节目、汉藏语系、x y z 该不该换甲乙丙丁、英制单位和火星探测器、山海经品牌命名、五立场光谱、叠甲……

如果按收到顺序堆,文章会变成补丁摞补丁。所以每一轮的规矩是:发散阶段不设限,收敛阶段有铁律——每个点必须挂进论证链,挂不进去的删,挂得进去的全局重排。比如”英制单位”这个点,最终没有散落在某段里,而是成了”把极端保守逻辑推到底”一节的收尾重锤:英制的发明国英国都改公制了,美国抱着不放,1999 年火星探测器因单位混用坠毁——“语言上的英制单位,就是强制全称翻译”。一个点子的价值,取决于它最终被安放的位置。

第五课:叠甲是批判文的自带装甲

批判性文章最怕的不是被反驳,是被故意读歪。所以成文前专门加了一节”先把甲叠好”:不反对译名规范化、不反对母语保护、不反对信达雅、不主张全盘英文化、段子笑的是强制全称不是医护群体、批评的是论证结构不是个人动机。

这六条甲,每一条都堵住一种常见的歪读。叠甲不是软弱,是精确——它把讨论逼回到真正有分歧的地方:你反对的不是我说的这些,那你到底反对哪一句?这一招和前几天那篇说的”验收标准”是同一件事:先把”什么叫反驳了我”定义清楚,讨论才有效率。

再收敛一步:这套流程本来就是学术论文的流程

回头看会发现,”发散—核查—框架—成文—互审—收敛”这套循环,和学术论文的标准生产流程几乎是同构的——批判文章只是这次抽中的一个选题。把环节对齐来看:

学术论文环节 这次协作里的对应动作
选题:发现问题 “这文章太蠢了”——从反直觉的现象里提出问题
文献综述与调查 找到两篇矛盾文献原文和名词委公告,再补十三条文献,凑齐十六条来源
提出论点(假设) 靶子经核查修正为:”词元没错,扩大化才有问题”
论证与实验 多轮成文互审,每个证据挂进论证链,挂不进的删
同行评审 双向纠错:用户当”感受性审稿人”,AI 当”事实性审稿人”
可复现性 参考文献前置、原句引用、术语挂机构链接,论断全部可验证
Limitations “先把甲叠好”——预写边界,堵住误读
结论与展望 光谱定位,收敛为三条可执行建议

第二行有个细节值得单独展开:文献调查的产出,经常不是”支持假设的材料”,而是”修正假设的材料”。我们本来是要去批评名词委的,调查完发现它做得最规矩,该批评的是抢跑的报道和扩大化的锐评——假设跟着证据走了,证据没有跟着假设走。这正是学术训练和网上吵架的分界线。

这套流程换题材照样成立。做数据论文,”核查”变成数据清洗与真实性检查,双向纠错变成数据复核;写综述,”素材分三堆”直接就是文献筛选标准;做实验报告,叠甲那一节对应的就是 Limitations;连课题申报书也适用——先定框架再填内容,总比写完一堆再砍结构省力气。学术训练的本质从来就是”发散—核查—收敛”这个循环,AI 改变的只是循环的执行成本:查证快了、成文快了、重排快了。但问题意识和价值判断,依然百分之百是人的活。

这就是 Skill 的意义

复盘完整个流程,你会发现这套打法是可复用的:先核查再开火、用户定尺度、双向纠错、发散收敛分离、成文前叠甲。下次再写考证型评论文章,如果把这些规矩从头再谈一遍,成本很高;把它们固化成一份指令文件,随取随用——这就是 Skill 的本质:把”这次是怎么成功的”翻译成”下次怎么稳定成功”

不只是人总结经验给 AI 用。当用户和 AI 合作跑通了一件事,或者 AI 在某次任务里自己发现了一条更好的路径,都可以沉淀成 Skill——这可能是 AI 时代个人知识管理最实在的形态:你的方法论不再躺在笔记里,而是活在工作流里。

最后一课:让另一个Agent来查证

有一件事要坦白:今天这篇词元文章的流程里,引文核查主要靠第一Agent自查加人工抽验,第二Agent交叉查证这一步并没有完整执行——它的完整上下文和提示词也没有展示过。坦白这一点,恰恰因为这一步百分百有必要:人写完都要自己再检查一遍,AI 更需要,而且要换一个 Agent 来查。

原因在于第一Agent的结构性弱点:它带着完整的上下文和自己的思维链,对产出有路径依赖——它会顺着当时的推理相信”我写的没错”,而错误恰恰藏在这条链的盲区里。所以查证Agent必须满足三个条件:

  1. 换模型。用和第一Agent不同的模型,避免共享同一套模型偏好和思维链路——两个不同架构的模型同时犯同一个错,概率远小于同一个模型连犯两次。
  2. 只认原文。查证Agent的唯一依据是被引链接的原文,不接受第一Agent的任何转述——转述本身就是可能失真的环节。
  3. 逐条输出三态结论:属实 / 失真 / 无法验证。不给”基本正确”这种模糊判断。

关于”换模型”,值得展开说细一点,因为它有成本梯度,可以按预算选档:

效果最好的,是两家不同派系的模型交叉——正文让 DeepSeek 写,核验就交给智谱的 GLM;或者 Claude 写、Gemini 查。不同厂商的模型,训练数据、分词器、偏好和盲区都不一样,同一个错误想同时骗过两套完全独立的系统,概率最小。

预算有限的话,同系列的不同档位也有效:让 DeepSeek 的 Pro 档写,再用 Flash 档查;或者新一代写、上一代查。同一家的不同时期、不同体量的模型,训练轮次和能力边界不同,错误分布只是部分重叠——查不全,但能查掉一大半,远好于不查。

效果最差的,是同一个模型自己查自己:上下文虽然重新开了,盲区却还是同一套盲区,属于聊胜于无的兜底。

至于为什么要”反复”核验:每一次核查都是一个有漏检率的过滤器,漏检率再低也不是零,而多过一遍过滤器,整体漏检率是相乘着往下走的。查证便宜,错误贵——用便宜的过滤器多叠几层,去拦昂贵的错误,这笔账怎么算都划算。

放到更大的场景里,这套打法解决的是互联网时代的老大难:消息良莠不齐,人工查证慢到跟不上造谣的速度。脚本爬取、信息附带原始链接、第二Agent对着链接反复校验——人最后只需要看”失真”和”无法验证”的短清单,查证成本直接降一个数量级。查网络观点如此,查论文参考文献也是如此。用之前那篇的话说:给 AI 递草稿纸还不够,还得给它安排一位互不认识的同事交叉签字。

附:可复用的 Skill(三套四份)

这次协作沉淀下来的东西,整理成三套共四份:第一套管协作总流程,第二套管框架收敛,第三套管查证——查证必须拆成两份,一份给写作的 Agent 1,一份给查证的 Agent 2。为什么拆?因为指令分离本身就是隔离:Agent 1 的技能里连”如何自我核查”都不该出现,它的职责边界就是”产出+附链接”;Agent 2 的技能里没有任何写作指导,只有核查规程。两份技能,分别加载到不同的模型上。均为 markdown 格式,可直接放进 agent 配置:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
---
name: collaborative-critical-essay
description: 与AI多轮协作生产考证型批判文章的完整流程。适用于观点强烈、
需要事实核查与文献支撑的博客、论文、深度评论写作。
---

## 角色分工
- 用户(主编):发散观点、价值判断、尺度把握、框架拍板
- AI(研究员兼执笔):事实核查、文献检索、结构化成文、反向纠错

## 工作流(六步循环)
1. 发散:用户倾倒全部观点与情绪,不要求准确;AI 只记录不反驳
2. 核查:AI 逐条核实,素材分三堆——可直接引用 / 修正后用 / 建议放弃;
并主动搜索用户没提到的反转与反例,找对真正的批评靶子
3. 纠偏:AI 直接纠正用户的事实错误(谱系、数字、年份、出处);
用户直接纠正 AI 的感受性错误(详略、口吻、重点、结构)
4. 框架:用户定死规范——参考文献前置并分组、关键论断原文引用、
术语挂命名机构链接、百科用可访问的源、对事不对人
5. 成文互审:AI 成文,用户逐点验收,追加观点后全局重排而非打补丁,
循环直到用户确认无遗漏
6. 叠甲收束:预写"本文不反对什么"堵住歪读;金句收尾;本地构建
验证后预览,确认再发布

## 硬性纪律
- 对事不对人:只拆论证结构,不攻击个人;让日期和文件自己说话
- 每个论断可核查:引文给链接,数字给出处,拿不准就标注"待复核"
- 用户的事实错误必须纠正,用户的框架决策必须执行
- 情绪是燃料不是地图:靶子以核查结果为准

第二套:管框架收敛。对应这次协作里”发散不设限、收敛有铁律”的那半个循环:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
---
name: diverge-to-framework
description: 把多轮发散的观点收敛为整体文章框架。适用于素材杂乱、观点多头、
多轮追加内容的写作前期。
---

## 流程
1. 全量登记:用户每条观点独立成行,先不评判、不合并、不删减
2. 归簇分组:按论证功能把观点归入四层——事实层、逻辑层、价值层、建设层
3. 定主线:用一条论证链串起所有簇;挂不进主线的观点明确标注"暂舍",
不静默丢弃
4. 输出骨架:章节标题 + 每节论证任务 + 对应素材编号,交用户冻结
5. 冻结后才成文:正文中每一段都能回链到素材编号,防止补丁摞补丁

## 纪律
- 每轮新增观点后全局重排,不按到达顺序堆叠
- 骨架冻结前的所有讨论只动结构,不写正文

第三套:管查证,按角色拆成两份。给 Agent 1 的这份里,刻意不出现任何”如何核查”的字眼——它的职责边界就是产出加附链接:

1
2
3
4
5
6
7
8
9
10
11
12
---
name: sourced-drafting
description: 供写作Agent(Agent 1)使用。产出内容时同步完成来源采集与
标注,为后续交叉查证提供基础。本技能不包含任何自我核查职责。
---

## 职责
1. 采集:引用任何外部信息时,用脚本或检索获取原文,记录原始链接
与抓取时间;禁止凭记忆转述
2. 标注:成文中每一条事实性论断都标注来源编号,正文与来源清单一一对应
3. 边界:不承担查证职责,不自行宣布"已核实";拿不准的内容显式
标注"待验证",留给 Agent 2

给 Agent 2 的这份,则通篇没有任何写作指导——它只认识”论断、链接、原文”三样东西:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
---
name: cross-model-verification
description: 供查证Agent(Agent 2)使用。必须加载在与写作Agent不同的
模型上(优先不同厂商,其次同系列不同档位),只依据链接原文逐条校验,
输出三态结论。
---

## 三原则
1. 角色隔离:不参考写作Agent的上下文、提示词与思维链,只接收
"论断 + 来源编号 + 链接"清单
2. 只认原文:唯一依据是链接原文;链接打不开或内容与论断无关,
一律判"无法验证"
3. 换模型:本技能应部署在与写作Agent不同的模型上——优先不同厂商
(如 DeepSeek 写、GLM 查),预算有限可用同系列不同档位
(Pro 写、Flash 查),最差才是同模型自查

## 流程
1. 逐条核对:比对数字、日期、限定词与上下文;转述与原文的任何偏差
都记为失真
2. 三态结论:属实 / 失真 / 无法验证,禁止输出"基本正确"
3. 短清单:只列失真与无法验证项,附原文摘录与链接,交人工终审
4. 回写后重查:修正稿重新过一遍第1-2步,直到清零

最后一句

这次协作里,人负责”什么是重要的”,AI 负责”什么是真的”,两套纠错系统并联跑完了全程。AI 辅助写作的最好状态,不是 AI 替你写,也不是你替 AI 改,而是你出尺子,它出卷尺——量完之后,谁错了改谁