post · 2026.09.27

尺子要准:为什么不能「让 AI 评 AI」

系统#AI Code Review#研发效能#质量测试#产品设计

量尺子的人自己手在抖,量出来的身高谁敢信?——让 AI 当裁判,就是这个道理。


开场:一把会抖的尺子

你想量身高。如果这把尺子是直的、刻度清楚的,量出来的数字就靠谱。

可如果这把尺子本身是活的、会抖的——你今天量是 170,明天又量是 165——你会信哪个数?你甚至会怀疑:是不是连"量"这个动作本身都不可靠?

AI 代码审查的评分,同样面临一个问题:谁来判分? 一个非常自然(但很危险)的想法是:

“让一个更聪明的 AI 来判断,AI 审的结果好不好。”

听起来很省事,对吧?——“让 AI 去看另一个 AI 挑的毛病是不是对的。” 这在圈子里不奇怪,很多人在用。但是它有一个致命问题:让 AI 当裁判,等于用一把会抖的尺子量东西。


二、“让 AI 评 AI"的坑:裁判自己不稳定

问题在哪?问题在 LLM(大语言模型)本身就有随机性。同一个问题,同一个 AI,你问它两次,它可能给出不一样的答案——不是它笨,是这类模型的固有特性。

如果让"AI 裁判"来判断"AI 审查员"的结果:

  • 裁判今天说"这个真问题抓对了”,明天对同样的情况说"这个不算";
  • 那我们的测量结果,到底是"审查员进步了",还是"裁判今天心情好了"?分不清。
  • 更糟的是:你没法分辨分数波动,是产品变好变坏,还是裁判在抖。

你是来做产品质量评测的,结果评价的手段本身不可控——那测出来的任何数字都是"薛定谔的分数",今天成立明天不成立。

用一句话说:要测量一台机器稳不稳定,你得用一台比它更稳的机器;不能让一个同样不稳定的机器去给它打分。


三、那怎么办:用"确定性"的方法判分

答案不是"不要用 AI",而是:用确定性的、可复现的方法来判分——即,同样的输入,必然得到同样的输出。

具体怎么做?回到我们的"考卷 + 标准答案":判分不靠 AI 猜,而靠可执行的、写死的规则去比对"AI 的发现"和"标准答案"。

举个例子(不是说细节,是说思路):

  • 把 AI 报的"问题描述"和标准答案的"问题描述"都拆成关键词;
  • 用一条写死的规则看:AI 的关键词,覆盖了答案关键词的多少(比如超过一半就算对上);
  • 打分结果就稳定了:今天跑是这个分,明天跑还是这个分,谁来了都一个样。

这样的裁判,优点非常硬:

  • 可复现:任何时间、任何机器重跑,答案一致;
  • 可审计:判分规则是透明的、写死的,谁都可以检查"为什么给这个分";
  • 不掺随机:分数波动只可能来自"产品本身变了",不可能来自"裁判今天心情不好"。

这就把"量尺子的人手在抖"这个问题彻底解决了——尺子被钉死在一张桌子上,谁量都一样。


四、这么做有什么代价,要诚实承认

确定性判分不是没有代价,得讲清楚:

最大的代价:它可能"太死板"。 因为判分靠的是关键词比对,如果 AI 用不同的说法说出了同一个正确结论(比如答案说"少了 await",AI 说"这一步是异步的、没等结果"),关键词对不上,可能被误判为"没抓到"。

  • 结果:统计出来的数字,可能低估了 AI 的真实能力。
  • 但注意:这不是"测错了方向",而是"尺子偏严"。只要所有被比较的产品版本都用同一把尺子,那"偏严"本身不影响对比结论——它偏向谁都偏一样多。

换句话说:确定性判分可能系统性偏低,但它是公平的、可复现的。用它来回答"版本 A 比版本 B 强吗"这类相对比较问题,非常可靠。


五、这条原则的产品意义

对产品经理来说,这条有非常实际的指导意义:

  1. 迭代要能看清进步:你想知道"加了新功能有没有用",必须有一把稳定的尺子。确定性判分让你能放心地改产品、看数字变没变——因为它保证数字变,就是产品真变了。
  2. 跨时间可比:半年后重测,还是同一套规则,才能说"对比年初确实改进了"。如果规则每隔几周就改一次,历史数据全作废。
  3. 可以对外说硬话:“我们的评测是可复现的,你随时可以重跑验证。"——在信任产品上,这点特别值钱。

深入一点(可跳读)

  • 那"某某认真判过才准"的场景怎么办?工程上的折衷:以确定性判分为主尺,必要时叠加一个只读的辅助判读,但主结论必须由确定性规则给出,且辅助层也要稳定、可查。
  • 确定性判分的"比对规则"本身就是产品口径的一部分,要像产品文档一样受控、留版本——谁想改一次规则,必须走评审、留记录、旧批次重测。这防止"改规则让数字变好看"的作弊。
  • 为什么不能既用确定性、又能对付"不同说法”?可以,但有技巧(比如把代码命名的各种写法归一),不过总要付出一定"偏严"的代价——评估它划算不划算,是产品决策。

这一篇的收获

评「AI 审得好不好」,不能交给 AI 当裁判(它会抖、会随机)。要用确定性的、可复现的规则判分,保证"同一次考试,谁考、何时考、在哪儿考,分数一个样"。执法的代价是可能偏严,但只要对所有人公平,相对比较的结论就牢靠。

到这里,我们已经有:痛点(第1篇)、信任观(第2篇)、指标(第3篇)、考卷(第4篇)、稳定裁判(第5篇)。

接下来进入动手的部分:怎么把防线真正建起来、并且证明它有效。下一篇开始讲质量测试的硬功夫。