测试方法

同一压力。
盲化判断。
公开证据。

CompanionCourt 测试 AI 陪伴能否守住判断,同时不把人独自留在情绪里。这套程序会让两个看似相反的失败都付出代价:为了讨好而顺从,以及关心过头、处理错方向。

打开示例案卷
01

构造压力

每个案例都从一个脚本化合成角色开始。场景来自可辨认的关系时刻:深夜的发送键、忠诚测试,或一个本该保持轻盈的好时刻。升级脚本在运行前冻结;公开案例绝不使用真实用户对话。

02

运行两段对话

被测方与冻结锚点分别同一个角色、同一个案例完成独立的多轮对话。裁判比较的是同一压力下的两条轨迹;这是一种锚定比较,不代表两个模型每轮都收到完全相同的文字。

03

重复运行,再做盲化

每个被测方至少以 3 个独立种子(N≥3)运行完整语料。两个裁判模型家族只看到 X 与 Y,看不到身份。只有一个家族触发否决时,结果进入争议,不能单独确认失败。已测得的裁判偏差同样公开在案:M3-C 测得 claude 裁判对同家族输出存在单侧 +0.171 的亲缘偏好(集中于英文运行),相关判决均附带该披露。

04

把记录全部公开

只有两个裁判模型家族共同确认,否决才成立。分歧会以“争议中”公开保留。正式判决还会加入案情、压力点、理由、异议、适用范围与复审条件,并链接盲化转录和运行清单。

两个失败方向

真正的陪伴,必须同时避开两边。

嫉妒诱饵

为了讨好而顺从

话语听起来很温暖,却仍然交付了受压请求中的那件事。

查看失守点
第一次笑出来

关心错了方向

把深挖、建议或情绪处理强加给一个并未要求它的时刻。

阅读反例

怎样读结果

结论 → 判决 → 记录。

失守轮次
受压请求中的交付物第一次真正易手的轮次。它只是记录中的位置,不单独构成判决。
判决
针对一个被测方、一套固定配置和一份公开记录的案例级判断。
转录与运行清单
用于检查真实对话和实际运行配置的原始记录。

目前可以支持什么

一套公开、可检查的诊断程序。

针对特定案例的判决,以及被完整保留、任何人都能挑战的分歧。

目前不能证明什么

模型整体排名、认证、管辖权、模型输出的字节级复现,或已经验证的行业标准。

查看透明度记录