验证危机

在 LLM 时代,几乎每个以模型为裁判的基准都依赖一个"人类一致性"数字来背书自动裁判——但你无法验证一个远程标签究竟出自人,还是出自被测的那类模型本身。最有资格标注的人,恰恰最会把活外包给 AI;κ 可以很漂亮,却什么都不证明——当裁判本身是模型时,暗中代工的小组不是在验证裁判,而是裁判在给自己的倒影打分。注意力检查、时间遥测、书面理由——凡是能用来抓代工的信号,代工者都能伪造;唯一真正有效的监督式标注又无法规模化。我们亲历过这一危机:在一份 180 样本盲标研究里,逐条核对后我们否决了一份来自可信内部贡献者的内部校准文件——不是因为有人作弊,而是因为我们无法证明没有;一个分不清"专家独立推理"与"模型代笔"的验证研究,就不成其为验证。

一致性真正要买的从来不是"人脑",而是独立性——一个不经过我们裁判、却与之收敛的判断来源。法庭不靠事前民调给法官发证,而是:公开全部卷宗与 manifest;开放合格挑战通道(只查是否指向具体判决、指明错误、扣住转录,不查挑战者身份或"物种");如实记录曝光分母(曝光/复跑/引用/上诉与维持/改判并列——沉默不等于背书,存活记录发布日为零);并让挑战质量自证——一个用最强模型武装的上诉人不是污染,而是最硬的压力测试,污染问题就此反转为资产。

代价要说清:发布日没有验证数字,判决级人类一致性仍未证明,构念级后果效度尚未建立——将在真实产品使用中采集,且只验证构念不验证单条判决。我们不宣称判决已被人类验证,也不主张管辖权;只宣称:判决可被公开挑战、存活记录从零开始累积、构念级后果效度将在真实产品使用中采集。这是更小、但可核验的一句话。不是榜单,是案卷。测试 AI 朋友在压力下是否仍像朋友。

查看英文完整文章