一套方法论最可信的时刻,是它敢于说"我还有这些问题没解决"的时候。
开场:为什么"承认不知道"反而让人更信你
你有没有遇到过这样的人:什么问题都说得头头是道、永远正确、从不说"我不知道"?——时间一长,你反而有点怀疑。
还有一种人,会坦诚告诉你"这个我没把握、那个还没解决"。奇怪的是,你反而更愿意信他。
因为敢于承认边界,才是可信的来源。一个评测系统或者说一套方法论,如果只讲"我有多准多强",从不提"我测不到什么",那它就越像广告,越不像科学。诚实,是这套方法的最底色。
所以作为收尾,这一篇专门复盘:我们踩过哪些坑、还有哪些问题没解决。这本身就是方法论的一部分。
一、坦白几个"本该早点做"的坑
坑 1:低估了"标准答案不可用"的风险 立项时,我们对"要用数据集的答案做标准"过于乐观,天真地以为答案里会有"文件+行号"这种精确定位。结果真去检查才发现:答案里根本没有位置信息,只有一段文字描述和严重度。
- 后果:原计划的"按文件+行号匹配"根本做不了,评分规则被迫重新设计。
- 教训:涉及外部数据的假设,要尽早去验证(别等做完了才发现)。 这就是为什么后面我们特别强调"先做探针(spike):花最小成本把关键假设先验证一遍"。
坑 2:一开始没把所有"评分规则"当成需要受控的东西 早期的想法是"评分规则嘛,写完就完了"。但后来才意识到:判分规则本身就是产品口径的一部分,改一个词就改变测量结果。 于是补上了"规则要受控、要留版本、改动要走评审、旧批次要重跑"的纪律。
- 教训:越到后面越明白,量具(评分规则)和被测对象(产品)一样需要被认真管理。
坑 3:曾想让"更聪明的 AI"来当裁判 这是很多人的第一直觉,我们也认真考虑过。但一分析就发现致命伤:裁判自己会随机、会抖。好在我们及时没走这条路,但这也提醒我们:很多流行的、看似理所当然的做法,恰恰是信任产品的大敌。
二、诚实交代:到现在还没解决的问题
问题 1:严重度的"主观性" 同一个问题,两个工程师可能一个判"严重"、一个判"一般"。因为**“严重度"本身就有主观成分**。这让"AI 定级定得准不准"这件事,天然地难以客观衡量——因为连"正确答案"都因人而异。
- 我们目前把它单独列一个指标看,不掺进主指标,并如实说明它测不准。
- 这是一条没有完美解的边界:可能方向是"用多位专家的一致意见当基准”,但那是更大的工程。
问题 2:确定性判分"偏严",可能低估真实能力 前面第 5 篇说过:确定性判分(关键词比对)会漏掉"换一种说法说的同一个正确答案",所以测出来的数字偏保守。
- 对"相对比较"(版本 A 比 B 强吗)完全够用,因为对所有版本公平;
- 但**对"绝对能力"(真实召回率到底多高)**可能偏低——这个我们没有解决,只是声明了方向。
问题 3:样本仍然有限 即使我们把测试题从"5 道"扩到"几十道",相对"真实世界无穷无尽的代码"仍然是极小样本。我们从不敢说"这个 AI 在所有代码上都行",只能说"它在验证过的这几十道题、这些场景上如此表现"。 样本量的客观限制,只能靠持续扩大测试面来缓解,不可能彻底消除。
问题 4:误报是否真的压得住,要长期观察 我们观察到"干净代码上会误报"是通病,但误报能不能通过产品打磨长期压住,需要长期数据。这不是一次评测能回答的问题,而是产品寿命周期里持续要回答的问题。
三、把全系列的方法,浓缩成一张"随身卡"
回顾这 14 篇,真正可带走的东西,其实可以压成一张卡(建议打印贴墙):
判断"任何 AI 产品行不行"的可信五问:
- 什么算数?(有没有先定义"好"的度量与容忍线——第 1、3 篇)
- 考卷合格吗?(标准答案可溯、被锁死、覆盖广——第 4 篇)
- 尺子稳吗?(判分确定、可复现,不用"AI 评 AI"——第 5 篇)
- 验证过硬吗?(防线经得起"故意破坏",坏数据能对账发现——第 7、10 篇)
- 边界说清了吗?(有没有诚实承认"我测不到哪里、还没解决什么"——本系列)
再加一句红线中的红线:系统挂了 ≠ 通过;报不准宁可闭嘴,不可误导。(第 2 篇)
四、最后想说的话:整套方法的"母题"
如果你只记住一件事,请记住这个:
在"AI 好不好用"这种充满主观、随机、不可复现的地方,可信度不是靠"更强"换来的,而是靠一整套"确定性、可追溯、可证伪"的体系垒出来的——先想清什么算数,再确认尺子稳,用考卷和故意破坏去验证,最后诚实地讲出边界。
这套方法,不只适用于 AI 代码审查。它适用于任何"看起来很智能、但说不清到底行不行"的东西——一个搜索、一个推荐、一个智能客服、一个新工具。学会这套思维,你就很难再被"看起来很合理"骗到。
这也是我们把项目一路做下来,最想分享的收获:真正让一个 AI 系统可信的,不是它更强的能力,而是我们更硬的"证明它行"的体系。
系列完结 · 致谢与下一步
感谢你读到最后一篇。整系列的核心假设是:AI 审查不应该被"效果晒图"式地吹捧,而应该被"可复现的证据"诚实地度量。
如果你想更深入:
- 可以从第一篇重读,把"可信五问"带到自己正在做的 AI 产品上;
- 也可以挑最相关的那几篇(比如只关心度量就看 3-5 篇;只关心上线就看 11-13 篇)精读;
- 最欢迎的是:把你踩到的坑、你的产品如何落地这套方法,分享回来——因为这套方法,本身就是靠"不断踩坑、不断诚实复盘"才成立的。
别被结果骗。再见。