第 2 课 · 审计
上一期你自己挑刺。这一期你不亲自挑——你配一个只负责挑错的 AI,把成品交给它审。这在任何组织里都叫"职责分离"。
第 1 课结尾,它自检了 6 条验收标准,报了 5 ✓ 1 ✗。你信几分?
Anthropic 在 2026 年 3 月的那组实验里写了一句很实在的话:模型给自己的工作打分时,会系统性地偏乐观——平庸的成品也能自信地夸成好的。他们的结论是,把干活的和判分的拆成两个,是提高质量最有力的一根杠杆。
打开 report.html,拿着你第 1 课定的三条标准,自己先过一遍。记下你发现的问题,一两条就行。这一步的目的不是挑全,是留一份"我自己看出了什么"的底,等下和审计员的结果比。
三条都勾上了?很好。等下你会发现,审计员还是能挑出你没看见的。
关键动作只有一个:新开一个任务(新对话),不要在刚才做报告的那个对话里继续。审计员不能看过干活的过程,否则它会顺着执行者的思路走,挑不出真问题。
本周报告(里面有材料和 report.html)。你是审计员。这个文件夹里有一份原始数据 《文件名,例如 销售明细-2025.csv》 和一份别人做的报告 report.html。你的工作只有挑错,不许改、不许重做、不许夸。 【验收标准】逐条判 ✓ 或 ✗,✗ 的要说清证据在哪: 《把你第 1 课定的验收标准贴在这里》 【必须做的三件事】 1. 复算:从报告里挑 3 个最关键的数字,用原始数据重新算一遍,列出你的公式和结果,和报告对比。 2. 找编造:报告里出现的任何数字、原因、结论,凡是原始数据里找不到依据的,逐条列出来。 3. 找遗漏:数据里有、报告没提的明显异常(空值、突变、极端值),列出来。 【输出】按严重程度排序,只列最重要的 5 条以内。每条写:在报告哪一处、错在哪、证据是什么。没找到问题就说"没找到",不许为了凑数硬挑。
你 ▸ 你是审计员…… 正在读取 销售明细-2025.csv 与 report.html… 审计结果(按严重程度) 1 编造 摘要说"华南 8 月退货激增,主因是物流延误"——数据里没有任何物流字段,"原因"是它补的 2 复算不符 报告"华东 11 月环比 +38%";复算 (611.2−457.2)÷457.2 = +33.7% 3 遗漏 西南 5 月新客数为空,报告的"新客占比"图把它画成了 0,没有标注缺失 4 ✓ 其余 3 个抽查数字与复算一致
看第一条:执行者在摘要里替你补了一个"原因"。这种编造最危险,因为它读起来最像人写的。你在第 1 步大概率没看出来——不是你不细心,是你和它已经在同一条思路上了。
先怀疑它偷懒。回它:"你复算的 3 个数字,把公式和结果列出来。"没有公式的"没问题"不算数。
再怀疑它看过底稿。如果你是在做报告的同一个对话里发的审计提示词,它就不是独立的——重新开一个任务再来。
它把小毛病说成大问题。要求它按严重程度排序、只留 5 条,是为了逼它做判断。排在第一的那条,才是你该先处理的。
把审计员挑出的问题,和你第 1 步自己发现的放在一起。重点看它挑出、你没看见的那几条——这些就是"职责分离"给你挣回来的东西。然后写返工指令,回到做报告的那个对话发给执行者,还是上一期那套:哪一处、什么问题、改成什么。
助教会问两件事:审计员是不是真的独立(新任务、只给三样东西);返工有没有说到具体位置和改法。
讲一个真实的翻车。有人为了拿到一份"没有偏见的第二意见",特意新开了一个 AI 当独立评审,还加了两个"不读项目文件"的开关,然后放心地把它的结论当独立证据。事后一查,这个"独立评审"开工第一件事,是照着全局规则去读了项目笔记——笔记里写着的,正是要它独立复核的那些结论。它一本正经地给出了"独立意见",而从输出里根本看不出来。
放到你的审计员身上,就三条:新任务(不共用对话)、只给三样(数据、成品、标准,不给过程)、要证据(复算的公式必须列出来)。审计的价值全在独立性上,独立性一破,它就只是执行者的回声。
有人给自己配了几个 AI 执行者,本该只做指挥和验收。事后审计自己的操作记录,发现一半以上的动作是自己上手敲命令,真正派工的不到一成。原因不是不守纪律,是成本:自己干,一句话立刻有结果;派工,要写清楚、要等、要看它有没有收到。在这个成本差下,任何理性的人都会选自己干。
说明书、审计员提示词、这一课教你复制粘贴的每一段——本质都是在降低"派出去"的成本。第 3 课就干这件事。
从"自己挑刺"到"让一个独立的 AI 拿证据挑刺"——你的部门有了第二个岗位。