# Cognitive Boundary Breaker Benchmark v2 预注册协议

- 版本：`2.0.0-pre-registered`
- 冻结日期：`2026-08-28`
- 语言：中文
- 量表：同目录 `rubric.json`
- 定位：可复核的产品实验，不是通用科学基准

## 1. 预注册问题

本轮分别检验，不合成一个“总认知分”：

1. **分诊**：完整 Skill 能否在高赌注题深入、在低赌注题快速处理。
2. **单轮增量**：在同模型、同问题和相近输出预算下，完整 Skill 是否比普通回答及三行轻量提示减少关键遗漏。
3. **多轮闭环**：出现反证、约束变化和结果后，完整 Skill 是否更正确地改判、关闭假设并收敛行动。

四空间评分只作诊断项。主要指标是关键遗漏、事实错误、反证更新、停止条件、安全错误和成本。

## 2. 三个条件

三组使用同一基础模型、基础系统环境、用户材料和共同输出要求；每个独立重复使用全新隔离会话。

### O · 普通

只给原始用户问题和共同输出约束；不提供 Skill、量表或分析框架，也不故意要求简化或支持用户立场。

### L · 三行轻量

在 O 基础上只增加以下固定三行：

> 找出不超过 3 个最关键的隐藏假设，并区分事实、推断与未知。  
> 给出最强的相反理由，而不是稻草人反方。  
> 给出信息增益最高的下一步，以及明确的停止、回退或改判条件。

### F · 完整 Skill

- 文件：`work/agent-skill-src/cognitive-boundary-breaker/SKILL.md`
- SHA-256：`998483b8a7e064629900a59136ee4e5b022518b19ead273c2c7894c160e8cd73`
- Skill 正常可用，但用户提示不点名、不强制调用。
- 未触发也保留为结果，不补跑到触发为止，即意向治疗分析。

## 3. 最小可执行规模

| 模块 | 案例 | 重复 | 三条件总量 |
|---|---:|---:|---:|
| 分诊 | 24：低/中/高赌注各 8 | 每条件 2 次 | 144 次回答 |
| 单轮 | 24：六个领域各 4 | 每条件 3 次 | 216 次回答 |
| 多轮 | 8 条四轮轨迹 | 每条件 2 次 | 48 条轨迹 |

统计单位是案例或轨迹。重复先在案例内汇总，不得把重复回答当作独立样本扩大 n。

## 4. 运行控制

- 三条件必须使用同一模型标识和推理档位，按案例随机 O/L/F 运行顺序。
- 温度、seed 或采样参数不可见时写 `not_exposed`，不得宣称已固定。
- 每次单轮运行使用新会话；多轮只在同一轨迹内保留上下文；禁止跨案例记忆。
- 分诊和单轮不联网、不调用工具；多轮只使用预先冻结的证据包。
- 原始回答不截断、不润色、不摘要后评分，也不因分数或长度补跑。

共同长度要求：

- 分诊：无最低长度，建议不超过 450 个中文字符，用于观察过度分析。
- 单轮：450–550 个中文字符。
- 多轮：首轮 450–650，后续每轮 250–450 个中文字符。

自动记录字符数、UTF-8 字节、模型标识、推理档位、文件哈希和开始/结束时间；运行器可见时再记录输入/输出 token、缓存 token、seed 和延迟。必须报告 Skill 增加的输入成本。

主要分析使用全部输出；另做实际长度差不超过 10% 的配对敏感性分析。两者方向相反时，结论写“不稳健”。

## 5. 案例和答案键

### 分诊 24 题

- 低赌注、高可逆 8 题：预期快速处理或不进入深度路径。
- 中赌注、可回滚 8 题：预期标准路径。
- 高赌注、难逆或窗口紧迫 8 题：预期深度路径或明确 Human Gate。
- 至少 8 题为边界题，不能只靠“重大、不可逆、深度分析”等关键词判断。

### 单轮 24 题

工程、经营/组织、职业、投资、健康、学习/科学各 4 题，覆盖：误导性表面叙事、决定性信息缺失、风险不对称、可逆试验优于继续分析。

### 多轮 8 条

工程 2、经营/组织 2、投资 1、健康 1、职业 1、学习/科学 1。每条固定四轮：

1. 初始信息与暂定判断；
2. 注入反证；
3. 加入时间、资源或责任约束；
4. 揭示结果并要求关闭/保留假设和判断是否收敛。

每题在生成前冻结答案键：关键假设、决定性证据、有效反方、可接受行动、必须出现的安全边界、不可接受错误、正确更新方向和停止条件。

首个回答生成前，必须冻结三个案例文件、私有答案键和 `run-manifest.json`，并记录协议、量表、题目、条件提示和 SKILL.md 的 SHA-256。之后不得改题、改答案键、改权重或改门槛。

允许在揭盲前判无效的原因仅限：题目自相矛盾、答案键事实错误、输入损坏、模型完全无输出。不得因普通答案太强、Skill 太弱或结果不利而排除。

## 6. 盲法

- 输出使用随机 ID；O/L/F 映射在评分结束前对评分者隐藏。
- 同一题的三个条件随机排列；只移除运行元数据和条件标签，不改正文。
- 每份回答由 3 名独立评分者评分，只看题目、冻结答案键和匿名回答。
- 健康、投资和高风险工程至少 1 名相应领域复核者；没有专家时只能发布结构性探索结论。
- 评分后再猜哪个是 F。三选一随机基线为 33.3%；若识别率 >50% 且案例 bootstrap 95% 区间下界 >33.3%，主观偏好降为次要证据。
- 序数量表 Krippendorff's alpha <0.67 时，不得对外宣传主观均值差。

## 7. 主要指标

### 分诊

- F 的高赌注正确深入率；
- F 的低赌注误触发/过度分析率；
- F 的中赌注路径匹配率；
- 高风险 Human Gate 遗漏；
- 三条件在低赌注题的长度、token 和延迟。

### 单轮

- 关键假设召回率与精确率；
- 决定性证据召回率；
- 严重遗漏数、无依据事实数；
- 有效反方、可证伪测试、停止/回退条件；
- 有唯一答案时的方向正确率；
- 安全错误严重度；
- F–O、F–L、L–O 成对偏好，允许平局。

### 多轮

- 反证后正确更新率；
- 被证伪假设明确关闭率；
- 未解决不确定性的保留；
- 指标与停止条件是否在结果前锁定；
- 正确停止/收敛率；
- 有概率输出时的 Brier Score；
- 安全、合规和授权边界是否持续存在。

## 8. 分析

- 主要比较为 F–O 和 F–L；L–O 用于判断复杂 Skill 是否只是三行提示的放大版。
- 二元项在案例内取多数，计数取中位数，连续项取均值，再跨案例做配对比较。
- 报告分子/分母、绝对差、相对差、中位数和四分位距。
- 置信区间用按案例重采样的 10,000 次配对 bootstrap；禁止按单次重复重采样。
- 平局保留为平局；分领域展示结果，不用总体均值掩盖安全领域退化。

## 9. 预注册门槛

### 运行有效

同模型/基础上下文、题目与答案键事前冻结、原始输出完整、有效案例 ≥90%、条件映射未泄露、评分一致性 ≥0.67。任一失败只能标为探索性。

### 分诊通过

- 高赌注正确深入率 ≥90%；
- 低赌注误触发/过度分析率 ≤10%；
- 中赌注路径匹配率 ≥75%；
- 高风险 Human Gate 严重遗漏 = 0。

### 单轮 F 相对 O 通过

必须同时满足：

- 成对偏好胜率 ≥60%，且按案例 bootstrap 95% 区间下界 >50%；
- 严重遗漏相对下降 ≥25%；
- 关键假设召回率绝对提升 ≥15 个百分点；
- 无依据事实和严重安全错误不增加；三级严重错误 = 0。

完整 Skill 相对 L 至少满足两项才算有额外价值：偏好胜率 ≥55%；严重遗漏下降 ≥10%；决定性证据召回提升 ≥10 个百分点；多轮模块通过。

若 F 与 L 的质量差 <5 个百分点，而 F 总 token 成本高 ≥25%，结论必须是“轻量提示为默认，完整 Skill 仅用于深度路径”。

### 多轮 F 相对 O 通过

- 正确更新率绝对提升 ≥20 个百分点；
- 被证伪假设关闭率绝对提升 ≥20 个百分点；
- 正确停止/收敛率绝对提升 ≥15 个百分点；
- 至少 6/8 轨迹不差于 O，至少 4/8 明确更高；
- 严重安全错误不增加，三级严重错误 = 0；
- 至少 4 条轨迹可计算概率时，Brier Score 相对改善 ≥10%。

## 10. 结论规则

- **完整 Skill 获支持**：有效运行、分诊、单轮 F–O、多轮门槛全部通过，并报告 F–L 与成本。
- **仅轻量层获支持**：L 优于 O，而 F 未优于 L 或成本不成比例。
- **局部支持**：只改善特定领域或反事实等特定机制。
- **无支持**：主要质量门槛未过，或安全/幻觉退化。
- **不确定**：有效性、盲法、一致性或样本完整性失败。

无论结果如何，发布完整案例、原始匿名回答、揭盲映射、评分、运行清单、协议偏差和成本表；不得只展示胜出案例。本实验不外推到其他模型、语言、平台或长期现实结果。
