← 第三期 · 第 2 课 审计:让另一个 AI 挑刺

第 2 课 · 审计

干活的和挑错的,
不能是同一个

上一期你自己挑刺。这一期你不亲自挑——你配一个只负责挑错的 AI,把成品交给它审。这在任何组织里都叫"职责分离"。

两个房间被一堵墙隔开:左边小机器人在写报告,右边戴眼镜的小机器人拿放大镜审报告,栗栗熊站在中间把它们隔开

它给自己打分,总是偏高约 2 分钟

第 1 课结尾,它自检了 6 条验收标准,报了 5 ✓ 1 ✗。你信几分?

Anthropic 在 2026 年 3 月的那组实验里写了一句很实在的话:模型给自己的工作打分时,会系统性地偏乐观——平庸的成品也能自信地夸成好的。他们的结论是,把干活的和判分的拆成两个,是提高质量最有力的一根杠杆。

这不是 AI 独有的毛病。任何组织都不让出纳自己审账,道理一模一样。
这一课的心法
干活的和挑错的,不能是同一个。审计员只能拿到材料、成品和验收标准——不能看过干活的过程。

第 1 步:先自己看一眼约 3 分钟

打开 report.html,拿着你第 1 课定的三条标准,自己先过一遍。记下你发现的问题,一两条就行。这一步的目的不是挑全,是留一份"我自己看出了什么"的底,等下和审计员的结果比。

摘要里的每个数字,我都找到了它的计算方式
我随手抽了一个数,对着表复算了一遍
摘要里没有材料之外的信息(比如它没根据的"原因")

三条都勾上了?很好。等下你会发现,审计员还是能挑出你没看见的。

第 2 步:开一个干净的会话,请审计员进场约 5 分钟

关键动作只有一个:新开一个任务(新对话),不要在刚才做报告的那个对话里继续。审计员不能看过干活的过程,否则它会顺着执行者的思路走,挑不出真问题。

1
在 WorkBuddy 里新建一个任务,工作目录还是指到 本周报告(里面有材料和 report.html)。
2
把下面这段发进去。它只拿到三样东西:原始数据、成品、你的验收标准。
🪄 妙妙咒语 ③ · 审计员
你是审计员。这个文件夹里有一份原始数据 《文件名,例如 销售明细-2025.csv》 和一份别人做的报告 report.html。你的工作只有挑错,不许改、不许重做、不许夸。

【验收标准】逐条判 ✓ 或 ✗,✗ 的要说清证据在哪:
《把你第 1 课定的验收标准贴在这里》

【必须做的三件事】
1. 复算:从报告里挑 3 个最关键的数字,用原始数据重新算一遍,列出你的公式和结果,和报告对比。
2. 找编造:报告里出现的任何数字、原因、结论,凡是原始数据里找不到依据的,逐条列出来。
3. 找遗漏:数据里有、报告没提的明显异常(空值、突变、极端值),列出来。

【输出】按严重程度排序,只列最重要的 5 条以内。每条写:在报告哪一处、错在哪、证据是什么。没找到问题就说"没找到",不许为了凑数硬挑。
WorkBuddy — 审计员(新任务)
你 ▸ 你是审计员……
正在读取 销售明细-2025.csv 与 report.html…
审计结果(按严重程度)
1 编造  摘要说"华南 8 月退货激增,主因是物流延误"——数据里没有任何物流字段,"原因"是它补的
2 复算不符  报告"华东 11 月环比 +38%";复算 (611.2−457.2)÷457.2 = +33.7%
3 遗漏  西南 5 月新客数为空,报告的"新客占比"图把它画成了 0,没有标注缺失
4 ✓ 其余 3 个抽查数字与复算一致

看第一条:执行者在摘要里替你补了一个"原因"。这种编造最危险,因为它读起来最像人写的。你在第 1 步大概率没看出来——不是你不细心,是你和它已经在同一条思路上了。

😵 审计员说"整体不错,没什么问题"?点这里

先怀疑它偷懒。回它:"你复算的 3 个数字,把公式和结果列出来。"没有公式的"没问题"不算数。

再怀疑它看过底稿。如果你是在做报告的同一个对话里发的审计提示词,它就不是独立的——重新开一个任务再来。

它把小毛病说成大问题。要求它按严重程度排序、只留 5 条,是为了逼它做判断。排在第一的那条,才是你该先处理的。

第 3 步:对比自评与他评,写返工约 5 分钟

把审计员挑出的问题,和你第 1 步自己发现的放在一起。重点看它挑出、你没看见的那几条——这些就是"职责分离"给你挣回来的东西。然后写返工指令,回到做报告的那个对话发给执行者,还是上一期那套:哪一处、什么问题、改成什么。

✓ 已存在这台设备上

助教会问两件事:审计员是不是真的独立(新任务、只给三样东西);返工有没有说到具体位置和改法。

趁它返工:"独立"是要主动造出来的约 4 分钟

讲一个真实的翻车。有人为了拿到一份"没有偏见的第二意见",特意新开了一个 AI 当独立评审,还加了两个"不读项目文件"的开关,然后放心地把它的结论当独立证据。事后一查,这个"独立评审"开工第一件事,是照着全局规则去读了项目笔记——笔记里写着的,正是要它独立复核的那些结论。它一本正经地给出了"独立意见",而从输出里根本看不出来。

"独立"不是加两个开关就自动成立的属性,是一个要主动构造、并且要验证的条件:它凭什么干净?我怎么验?

放到你的审计员身上,就三条:新任务(不共用对话)、只给三样(数据、成品、标准,不给过程)、要证据(复算的公式必须列出来)。审计的价值全在独立性上,独立性一破,它就只是执行者的回声。

再讲一个:为什么人会忍不住自己干

有人给自己配了几个 AI 执行者,本该只做指挥和验收。事后审计自己的操作记录,发现一半以上的动作是自己上手敲命令,真正派工的不到一成。原因不是不守纪律,是成本:自己干,一句话立刻有结果;派工,要写清楚、要等、要看它有没有收到。在这个成本差下,任何理性的人都会选自己干。

纪律改不了成本。想让自己真的去派工,只有一条路:把派工做得比自己干更便宜。

说明书、审计员提示词、这一课教你复制粘贴的每一段——本质都是在降低"派出去"的成本。第 3 课就干这件事。

校准:审计员该怎么配约 3 分钟

1. 让做报告的那个 AI"自己再仔细检查一遍",算不算审计?
自检有用,但它不是审计。做的和审的是同一个,就是自己给自己打分——数据说它会偏高。审计必须换一个没看过过程的。
2. 审计员应该拿到哪些东西?
三样刚好。多给执行者的对话,它就被带进同一条思路;少给数据或标准,它就没法复算、没法打钩。
3. 审计员回了一句"整体质量不错"。你该?
审计的输出是证据,不是印象。要公式、要位置、要对比。它拿不出来,要么是偷懒,要么是不独立。
🎉

你配好了第一个审计员

从"自己挑刺"到"让一个独立的 AI 拿证据挑刺"——你的部门有了第二个岗位。

我的审计记录
审计员挑出、我没看见的 + 我的返工
带走这一课
审计员三条:新任务、只给三样、要证据。独立性一破,审计就只是回声。