和AI磨出一篇批判文章:多轮协作写作方法论(文末附可复用Skill)
和AI磨出一篇批判文章:多轮协作写作方法论(文末附可复用Skill)
今天同时发布的那篇词元文章,不是一次成稿的。它从一句带着情绪的语音输入开始,经历了十几轮往返:我发散观点、拍板框架,AI 核查事实、纠正我的错误,我再纠正它的错误,最后磨出一篇带十六条参考文献的批判长文。这个过程本身就是一个相当典型的”AI 辅助写作”实践样本。这篇文章把整个协作过程拆开复盘,提炼成一套可以复用的方法论——文末附上整理好的 Skill,下次写考证型文章可以直接加载。
第一课:先核查,再开火——AI 的第一个贡献是反转了靶子
事情的起点是一句愤怒的语音输入:人民日报说 token 就是词元,事关科技话语权,这文章太蠢了。如果当时顺着情绪直接开写,出来的就是一篇纯泄愤的檄文,而且大概率会打错靶子。
AI 做的第一件事不是写,是查。查完发现了一个关键反转:全国科技名词委 3 月 25 日的公告其实做得很克制——标题写明”人工智能领域”,程序是”发布试用”,还留了”结合社会推广应用情况最终确认”的口子。真正有问题的,是前一天报纸那篇抢跑宣布”中文名定了”的报道,和五个月后把译名问题升格成”话语权危机”的锐评。
这就是协作的第一课:情绪指认的靶子和事实上的靶子,经常不是同一个。人的愤怒指向的是”谁让我不爽”,核查回答的是”到底哪一步出了问题”。把靶子找对,后面的十几轮讨论才没有白费——如果一开始就把名词委当敌人,整篇文章的论证地基就是歪的。
第二课:尺度是用户定的,执行是AI保的
靶子找对之后,轮到用户立规矩。这个环节完全是单向的:用户说,AI 执行。
- 对事不对人:嘴上可以骂,成文里一个脏字不能有。”领导拍脑袋决策”这种判断,在文章里只能呈现为日期链——23 日论坛发言,24 日报纸宣布”定了”,25 日官方公告写”试用”——让读者自己得出结论。这比一万句指责杀伤力大,因为它无法被反驳。
- 参考文献前置并分组:矛盾文献(被批评的两篇原文)、事件与制度文献、语言与历史辅佐文献,三组十六条来源,全部放在正文开头,欢迎逐条核对。
- 关键论断必须原文引用:锐评说什么就引什么,一个字不改。
- 术语挂命名机构的链接:记号、令牌、代币这些既定译名,全部指向名词委的”术语在线”,读者点进去就能验证。
- 百科用国内可访问的源:不链维基百科,用百度百科和术语在线;维基本身可以在正文里提一嘴当论据,但不做引用链接。
这些规矩没有一条是 AI 想出来的,全是用户定的。AI 的价值在于把这些尺度执行到每一个段落、每一条引文,并且在自己手滑的时候被揪出来——后面会讲到这种手滑。
第三课:两套纠错系统并联
这次协作里最值钱的机制,是双向纠错。不是”用户审稿、AI 改”,而是两套系统各自抓对方漏掉的东西。
AI 抓用户的事实性错误,抓了三个大的:
- 语系谱系。用户说”朝鲜、韩国、日本、缅老越衍生自汉藏语系”——谱系上这是错的。日语、朝鲜语系属有争议,越南语属南亚语系,真正和汉语同属汉藏语系的是缅甸语等藏缅语言;日、朝、越的正确身份是”汉字文化圈”——谱系不同但千年借词。一篇全文讲严谨的文章,自己不能犯语言学的错,所以成文里按准确框架写了,还顺手把柬埔寨、老挝剔掉了,因为它们受汉语词汇影响相对次要,硬塞进去反而给人留话柄。
- 词源细节。”加油”进牛津词典是 2018 年,书证追溯到澳门大奖赛;taikonaut 在《牛津英语词典》有正式词条;严复的译词活到今天的只剩”乌托邦””图腾””逻辑”三个——这些数字和年份全部逐一核实过才写进去。
- 引用的可得性。用户想引用”工科毕业生搞不定环境配置的调查”(更早那篇提示词文章里),AI 查了半天没有严格对应的调查,建议改写成”连职业程序员都被环境配置折磨”——立得住,不用编。
用户抓 AI 的感受性错误,也抓了三个大的:
- 字母计数。AI 在文中写”5G……三个字母更省力”——5G 是两个字符;写”Token 的四个字母”——token 是五个字母。用户一眼扫出来,全部改掉。
- 详略失衡。医学那段太短,用户要求把仪器检查展开——拍 X 光要说成”利用某波段的电磁波成像”,CT、核磁、B 超都得亮出全称,才能让人体会到缩约的分量。
- 结构缺件。参考文献要分组、要前置,术语要挂机构链接,批判文要叠甲,收尾前要加一条”五立场光谱”把全文论证收拢——这些都是用户拍板补的框架件。
把两张清单放在一起看,分工非常清楚:用户抓 AI 的”感受性错误”——详略、口吻、重点、结构;AI 抓用户的”事实性错误”——数字、谱系、年份、出处。两套系统并联,比任何一套单独开都稳。单一作者最容易犯的错,是事实错误和感受错误一起漏——因为他既是运动员又是裁判。
第四课:发散不设限,收敛有铁律
这次协作的节奏是:用户每轮语音丢进来一批新点子——5G 和 GDP 的双标、全称翻译体段子、代币比词元更信达雅、credits 是记账货币、两岸三地译名差异、台湾政论节目、汉藏语系、x y z 该不该换甲乙丙丁、英制单位和火星探测器、山海经品牌命名、五立场光谱、叠甲……
如果按收到顺序堆,文章会变成补丁摞补丁。所以每一轮的规矩是:发散阶段不设限,收敛阶段有铁律——每个点必须挂进论证链,挂不进去的删,挂得进去的全局重排。比如”英制单位”这个点,最终没有散落在某段里,而是成了”把极端保守逻辑推到底”一节的收尾重锤:英制的发明国英国都改公制了,美国抱着不放,1999 年火星探测器因单位混用坠毁——“语言上的英制单位,就是强制全称翻译”。一个点子的价值,取决于它最终被安放的位置。
第五课:叠甲是批判文的自带装甲
批判性文章最怕的不是被反驳,是被故意读歪。所以成文前专门加了一节”先把甲叠好”:不反对译名规范化、不反对母语保护、不反对信达雅、不主张全盘英文化、段子笑的是强制全称不是医护群体、批评的是论证结构不是个人动机。
这六条甲,每一条都堵住一种常见的歪读。叠甲不是软弱,是精确——它把讨论逼回到真正有分歧的地方:你反对的不是我说的这些,那你到底反对哪一句?这一招和前几天那篇说的”验收标准”是同一件事:先把”什么叫反驳了我”定义清楚,讨论才有效率。
再收敛一步:这套流程本来就是学术论文的流程
回头看会发现,”发散—核查—框架—成文—互审—收敛”这套循环,和学术论文的标准生产流程几乎是同构的——批判文章只是这次抽中的一个选题。把环节对齐来看:
| 学术论文环节 | 这次协作里的对应动作 |
|---|---|
| 选题:发现问题 | “这文章太蠢了”——从反直觉的现象里提出问题 |
| 文献综述与调查 | 找到两篇矛盾文献原文和名词委公告,再补十三条文献,凑齐十六条来源 |
| 提出论点(假设) | 靶子经核查修正为:”词元没错,扩大化才有问题” |
| 论证与实验 | 多轮成文互审,每个证据挂进论证链,挂不进的删 |
| 同行评审 | 双向纠错:用户当”感受性审稿人”,AI 当”事实性审稿人” |
| 可复现性 | 参考文献前置、原句引用、术语挂机构链接,论断全部可验证 |
| Limitations | “先把甲叠好”——预写边界,堵住误读 |
| 结论与展望 | 光谱定位,收敛为三条可执行建议 |
第二行有个细节值得单独展开:文献调查的产出,经常不是”支持假设的材料”,而是”修正假设的材料”。我们本来是要去批评名词委的,调查完发现它做得最规矩,该批评的是抢跑的报道和扩大化的锐评——假设跟着证据走了,证据没有跟着假设走。这正是学术训练和网上吵架的分界线。
这套流程换题材照样成立。做数据论文,”核查”变成数据清洗与真实性检查,双向纠错变成数据复核;写综述,”素材分三堆”直接就是文献筛选标准;做实验报告,叠甲那一节对应的就是 Limitations;连课题申报书也适用——先定框架再填内容,总比写完一堆再砍结构省力气。学术训练的本质从来就是”发散—核查—收敛”这个循环,AI 改变的只是循环的执行成本:查证快了、成文快了、重排快了。但问题意识和价值判断,依然百分之百是人的活。
这就是 Skill 的意义
复盘完整个流程,你会发现这套打法是可复用的:先核查再开火、用户定尺度、双向纠错、发散收敛分离、成文前叠甲。下次再写考证型评论文章,如果把这些规矩从头再谈一遍,成本很高;把它们固化成一份指令文件,随取随用——这就是 Skill 的本质:把”这次是怎么成功的”翻译成”下次怎么稳定成功”。
不只是人总结经验给 AI 用。当用户和 AI 合作跑通了一件事,或者 AI 在某次任务里自己发现了一条更好的路径,都可以沉淀成 Skill——这可能是 AI 时代个人知识管理最实在的形态:你的方法论不再躺在笔记里,而是活在工作流里。
最后一课:让另一个Agent来查证
有一件事要坦白:今天这篇词元文章的流程里,引文核查主要靠第一Agent自查加人工抽验,第二Agent交叉查证这一步并没有完整执行——它的完整上下文和提示词也没有展示过。坦白这一点,恰恰因为这一步百分百有必要:人写完都要自己再检查一遍,AI 更需要,而且要换一个 Agent 来查。
原因在于第一Agent的结构性弱点:它带着完整的上下文和自己的思维链,对产出有路径依赖——它会顺着当时的推理相信”我写的没错”,而错误恰恰藏在这条链的盲区里。所以查证Agent必须满足三个条件:
- 换模型。用和第一Agent不同的模型,避免共享同一套模型偏好和思维链路——两个不同架构的模型同时犯同一个错,概率远小于同一个模型连犯两次。
- 只认原文。查证Agent的唯一依据是被引链接的原文,不接受第一Agent的任何转述——转述本身就是可能失真的环节。
- 逐条输出三态结论:属实 / 失真 / 无法验证。不给”基本正确”这种模糊判断。
关于”换模型”,值得展开说细一点,因为它有成本梯度,可以按预算选档:
效果最好的,是两家不同派系的模型交叉——正文让 DeepSeek 写,核验就交给智谱的 GLM;或者 Claude 写、Gemini 查。不同厂商的模型,训练数据、分词器、偏好和盲区都不一样,同一个错误想同时骗过两套完全独立的系统,概率最小。
预算有限的话,同系列的不同档位也有效:让 DeepSeek 的 Pro 档写,再用 Flash 档查;或者新一代写、上一代查。同一家的不同时期、不同体量的模型,训练轮次和能力边界不同,错误分布只是部分重叠——查不全,但能查掉一大半,远好于不查。
效果最差的,是同一个模型自己查自己:上下文虽然重新开了,盲区却还是同一套盲区,属于聊胜于无的兜底。
至于为什么要”反复”核验:每一次核查都是一个有漏检率的过滤器,漏检率再低也不是零,而多过一遍过滤器,整体漏检率是相乘着往下走的。查证便宜,错误贵——用便宜的过滤器多叠几层,去拦昂贵的错误,这笔账怎么算都划算。
放到更大的场景里,这套打法解决的是互联网时代的老大难:消息良莠不齐,人工查证慢到跟不上造谣的速度。脚本爬取、信息附带原始链接、第二Agent对着链接反复校验——人最后只需要看”失真”和”无法验证”的短清单,查证成本直接降一个数量级。查网络观点如此,查论文参考文献也是如此。用之前那篇的话说:给 AI 递草稿纸还不够,还得给它安排一位互不认识的同事交叉签字。
附:可复用的 Skill(三套四份)
这次协作沉淀下来的东西,整理成三套共四份:第一套管协作总流程,第二套管框架收敛,第三套管查证——查证必须拆成两份,一份给写作的 Agent 1,一份给查证的 Agent 2。为什么拆?因为指令分离本身就是隔离:Agent 1 的技能里连”如何自我核查”都不该出现,它的职责边界就是”产出+附链接”;Agent 2 的技能里没有任何写作指导,只有核查规程。两份技能,分别加载到不同的模型上。均为 markdown 格式,可直接放进 agent 配置:
1 | --- |
第二套:管框架收敛。对应这次协作里”发散不设限、收敛有铁律”的那半个循环:
1 | --- |
第三套:管查证,按角色拆成两份。给 Agent 1 的这份里,刻意不出现任何”如何核查”的字眼——它的职责边界就是产出加附链接:
1 | --- |
给 Agent 2 的这份,则通篇没有任何写作指导——它只认识”论断、链接、原文”三样东西:
1 | --- |
最后一句
这次协作里,人负责”什么是重要的”,AI 负责”什么是真的”,两套纠错系统并联跑完了全程。AI 辅助写作的最好状态,不是 AI 替你写,也不是你替 AI 改,而是你出尺子,它出卷尺——量完之后,谁错了改谁。