post · 2026.09.27

方法论的完整地图:从十三种具体方法,到一套「求真」的世界观(终章)

系统#AI Code Review#研发效能#质量测试#产品设计#方法论#求真

一座塔,不能只有尖顶。既有每一块砖(具体方法),也有把它们托起来的那个结构(世界观)。 这一篇把两者都给你:十三种能落地的学科方法,加上七件能带走的认知武器。


开场:先看整张地图,再逐块讲

回望这 16 篇,我们其实只做了一件事:把"一个 AI 代码审查到底行不行"这个含糊的问题,变成一个能给出可信答案的问题。

但这一路用的方法,远不止"做 AI 审查"。它们来自统计学、实验科学、软件工程、计量学、供应链安全、开源科学……然后被我们移植到一个全新领域(AI Code Review 评测),并且每一步都落到了可执行、可验证的代码里。

这篇终章,把整张地图摆出来。它分三层:

第三层 世界观(七件认知武器)  ← 往上升,是判断一切事物的通用眼光
第二层 学科方法(十三种具体方法) ← 借来了什么、用在哪里、实证是什么
第一层 工程动作(考卷/对账/对照/破坏测试/留底) ← 上一篇技术篇已摊开

本篇重点在同一时刻给你第二层和第三层:先讲清楚"我们用了哪十三种被验证过的具体方法、在哪个环节、实证是什么",再往上升一层,讲"它们背后其实是同一种求真的世界观"。


一、实验方法学:怎么保证实验是"诚实"的

① 预注册研究(Pre-registration)——来自心理/医学的开源科学运动

这是贯穿全项目的做法"口径先注册后运行“的学理化来源。

心理学家发现:如果你跑完数据再决定怎么分析,很容易无意识地挑选"让结论好看"的分析方式(统计学叫研究员自由度 / p-hacking)。解法是先把分析计划、判定规则、预期指标写成文档提交存档,再动数据——事后改口径要留痕、要解释、相关批次重跑。

我们的实证:对 scoror 评分规则、PR 选择标准,都是两度"先 commit spec 再构建”——这就是该方法的标准操作。

② 对照实验 / 控制变量(Fisher 实验设计)

V0 vs V1 两臂对比,是经典随机对照实验(RCT)的思路。RCT 的精华是**“仅允许一个变量改变,其余严格相同”**。

我们的实证:用代码 .replace() 机械生成 V1 提示词,保证除工具描述外逐字节相同。Fisher 的意义在于:把"归因"从猜测变成可检验的推断——两臂唯一差异是工具,任何指标差异只能归给它。

③ 黄金标准(Gold Standard)——来自检验医学/评测

对照测量时需要一个"权威参照"。

我们的实证:拿资深工程师确认过的评审意见当标准答案(GT)——它必须人工、高质量、独立,不能由被测系统自证。

④ 样本量与功效分析(Power Analysis)——来自统计学

样本太小,结论是彩票;样本足够,才有统计显著性。

我们的实证:×3 重复 + 扩到 24 题,都是为了提升统计功效、缩小置信区间。为什么 ×3?因为实测同模型同题成本差 88 倍——单次是运气。为什么从小样本起步再到扩量?这在成本约束下做渐进式功效设计:先小样看方向,再放大定显著性。而报告克制地声明"5 题小样本不足以证明普适"——这本身就是该方法要求的诚实。


二、软件测试工程:怎么证明"防线真的在防"

⑤ 变异测试 / 故障注入(Mutation Testing / Fault Injection)

“往数据里投毒、看它报警"不是恶作剧,是被验证过的测试强技术:故意篡改代码/数据,目的是检验测试本身能不能察觉错误——测的是测试的质量。

我们的实证:篡改 trace 的 token、改 bundle 一个字节——每一项都必须被抓住。只测"好数据能通过"是自欺;能查出故障才算防线有效。这和**红队测试(Red Teaming)**同源:用攻击者的心态验证防御。

⑥ 单一变量原则 + 边界值分析(Software Testing)

把输入按行为意义分成等价类,每类取代表值;特别盯边界——因为边界是 bug 密度最高的地方。

我们的实证:P1 的"同一份合法卷子只改一处”、line≥1、2000 行临界、50KB 临界、sha256: + 64 位十六进制、多字节 UTF-8——全是等价类 / 边界值分析。

⑦ 三层测试分层(Unit / Integration / Regression)

测试不是一锅粥,而是标准分层:

  • 单元测试(schema/截断/scorer 纯函数)= 最小可验证单元;
  • 集成测试(git 工具在真实小仓库、loader 校验真实 bundle)= 部件协作;
  • 回归测试(每个真实翻车案例固化)= 防旧 bug 复现——这是缺陷捕获到固化的闭环:P4 的 schema_version 缺失、“42” 行号,全部变成永久岗哨。

三、数据与结论可信性:怎么保证"结论可以跨时间复现"

⑧ 可复现性运动(Reproducibility Crisis / FAIR 原则)

大量论文结果复现不出来,主因是版本没锁、环境漂移、数据没归档。FAIR 四原则:

  • Findable:bench 目录、runs 目录、报告路径固定;
  • Accessible:考卷 bundle + GT 入库;
  • Interoperable:JSONL 标准格式;
  • Reusable:断点续跑 + trace 可回放(明确"十年后能复现")。

我们的实证:工具行为对齐而非调用、版本全锁定、lockfile 进库——全是为"防静默漂移"。这是量具必须比被测对象更稳的直接执行。

⑨ 审计追踪 / 防篡改(Chain of Custody / Provenance,源自法证学与供应链安全)

身份字段、config_hash、sha256 指纹、每份答卷自带户口本——本质是把**证据链(chain of custody)**用到数据上:每个数据件都能回答"我从哪来、谁改过、版本多少"(W3C 的 PROV 标准干的就是这个)。而"要求 AI 自报身份不信、只信宿主注入"= 法证学铁律:自证无信,物证为凭。

⑩ 三角验证(Triangulation)——来自社会科学方法论

用多个独立来源 / 独立方法验证同一结论。单一来源可被单一缺陷污染,三角验证让结论难被系统性误差同时打中。

我们的实证:trace 里的 resolved_model 和 artifact 里对得上、run_end 总账 vs 流水账对账、多模型交叉印证(P8 两个模型 R 同时 +50%)。

⑪ 计量学 / 量具校准(Metrology)

量具必须追溯到权威参照,并记录不确定度。

我们的实证:把截断行为与 Pi 对齐并写 spec = 校准;det-match 的 coverage 直方图 = 不确定度报告;说它是 recall 下界 = 声明系统偏差方向。一份诚实的测量报告,必须同时给出"测量值 + 不确定度 + 已知偏差方向"——我们全做了。


四、流程治理:怎么保证"不越界、可进可退"

⑫ 阶段门(Stage-Gate,Robert Cooper 的产品研发理论)

“每阶段结束展示退出证据 + 硬暂停"等待确认再进下一段——工业界验证过的 Stage-Gate:每个 gate 先审查产出(测试绿、spec 入库)再放行,避免带着坏地基往下盖楼。这也是为什么前三个阶段故意不碰模型——地基还没硬,不让上层承重。

⑬ 证伪主义(Falsifiability,Popper)

设计一个可能失败的实验,而不是一定会"成功"的实验。

我们的实证:P8 设计了"工具可能让指标下降"的可能结局、P2/P5 故意让坏数据过不了。能证伪的才是科学——如果设计时就笃定跑完一定得到"好"结论,那这个实验毫无价值。


五、诚实地说明两点

第一,这些方法没有一个是新发明。 它们来自统计学、心理学的证伪实验、软件工程、计量学、供应链安全和开源科学运动。这个项目的价值不在"发明方法论”,而在把它们整合移植到一个新领域,并且每一步都落到了可执行、可验证的代码里。

第二,尚有一些未完全解决的开放问题(我们如实写进了 spec,没有藏):

  • severity 的人工标注主观性——两个专家可能对同一问题给不同严重度,这本身是评测学难点;
  • det-match 只能覆盖"用词重合"的语义命中(recall 下界)——真实能力可能更高,但我们选了"可复现"优先。

承认边界,本身就是这套方法论的一部分。


六、上升一层:十三种方法,其实是七件认知武器

上面十三种具体方法,看着很多,但它们背后是同一种眼光。抽掉领域外壳,它们收敛成七个可以带去任何地方的认知习惯:

武器① 先定义"什么算数",再开始 (预注册 / 口径先注册)——没有度量就没有判断。做任何判断前先问"什么算数"。

武器② 尺子必须比被测对象更稳 (计量学校准 / 黄金标准)——要量清一个会抖的东西,得用更稳的尺子;一个独立、高质量的参照绝不来自被测系统自己。

武器③ 不允许自证——自己说自己好,不算证据 (审计追踪 / 法证学)——身份、结论、正确性,凡"自我申报"一律不信;必须来自独立来源。

武器④ 好测试,要学会"证明自己没骗我" (变异测试 / 故障注入 / 证伪主义)——主动搞破坏、主动找破绽;证伪优先于证实。一个经得起你故意刁难的东西,才值得信。

武器⑤ 归因要按住变量:一次是运气,多次才是规律 (Fisher 对照 / 样本功效)——把别的变量全部按住,多次多样本,才敢说"有信号"。

武器⑥ 白纸黑字,可回溯 (可复现性 / 审计 / 三角验证)——记忆不可靠、证据可靠;重要的判断都要留记录、可复核、多来源印证。

武器⑦ 敢说"我不知道",是可信的最后一块拼图 (可复现性危机的教训 / 边界意识)——公布边界、坦言未解,比把话说满更可信。


七、再上升一层:为什么这套世界观,今天特别值钱

我们生活在一个**“听起来很对"严重过剩**的时代:广告说"效果爆棚”,产品说"我们最先进",博主说"亲测有效",AI 也说"我很有把握"。多数声音既不要求自己被证明,也不承认自己有边界。

在这种环境里,最稀缺、最值钱的能力,不是"知道更多",而是"如何判断一个说法可不可信"。这套方法,本质上是给这个时代的一份防骗指南——不是防骗子,而是防那个在噪声里太容易被带走的自己。

它把科学最内核的怀疑精神,翻译成普通人能用的日常习惯:

  • 科学不是"我信",而是"我怎么才能不骗自己";
  • 求真不是"找证据证明我没错",而是主动去找可能推翻我的东西;
  • 一个判断的可信度,不取决于说的人多自信,而取决于它多经得起检查和反驳。

八、致这一系列:从一把尺子,到一种眼光

回望这 16 篇:

  • 一开始,我们只想做一把"能测 AI 审查的尺子";
  • 做的时候发现,要做一把好尺子,得懂考卷、对账、对照、自省;
  • 做着做着发现,这些其实不是"测 AI 的方法",而是**“在任何噪声里求真"的通用方法**;
  • 到最后,它不只是一把尺子,而是一种看待世界的眼光。

工具会过时、模型会换代、这套系统也会被更替。但"定义什么算数、用更稳的尺子、不许自证、主动找破绽、按住变量、留白纸黑字、坦言边界"这七种眼光,是你带走后、可以一直用在任何地方的东西。

一句话收束:在"AI 好不好用"这种充满主观性、随机性、不可复现性的地方,我们用一整套"确定性、可追溯、可证伪"的流程,把可信度从"感觉"抬升到"可复核的证据”。而真正让一个东西可信的,不是它有多强,而是我们有多讲究的"求真"。

系列,到这里,正式完结。

别被结果骗。每一次。