认知边界突破器 · 让 AI 不只顺着你说

在重要决定前
多看一个方向v2.0 · 小事快速通过,大事认真想清

它会帮你找出没说出口的假设,检查证据,也把最强的反对意见摆到桌面上。不是替你做决定,而是让你少一次想当然。

你不需要每次都做一场烧脑分析。简单问题直接回答;重要、难以反悔的问题,才值得停下来多想一步。

平台事实核实于 2026-08-27 欢迎转发 · 请让出处与边界一起流动 GO · 重新发明组织

从这里开始

先用一次,再决定要不要安装

没有学习门槛,也不需要编程。复制一句话,就能在你常用的 AI 里体验它。

30 秒体验

把这句话和你的问题一起发给 AI

适合会议前、方案评审、职业选择或任何你不想只听到赞同的时刻。

30 秒体验
我有一个重要问题。请不要先同意我,也不要直接给答案。先帮我:1)找出不超过 3 个关键假设;2)提出一个最强反方;3)区分事实、推断和猜测;4)给出一个最小验证行动。

我的问题是:
长期使用

在 AI 工具中使用

无需编程,在 ChatGPT、Claude、DeepSeek 或 Kimi 中设置并使用。

选择我的 AI

同题对比

同一个模型,会多看见什么?

以下五个虚拟情景展示:同一个模型在普通回答与读取 Skill 后,思考路径可能怎样变化。它们是单次输出示例,不代表平均提升,也不证明事实更准确。

单次模拟输出 · 同一默认模型 · 无联网与工具 · 普通回答没有被故意做差查看旧演示的完整原始回答

用户的问题

稳定工作,还是降薪去创业公司?

35 岁、收入稳定但两年没成长;创业公司现金薪资低 25%,期权条款未定,是否值得去?

普通回答同一默认模型环境 · 未读取认知边界

先把期权变成书面条款,核实跑道、客户、权限和岗位目标,并把降薪、福利和工时折算成两年真实成本;满足预设入职条件再去。

使用认知边界同一默认模型环境 · 读取完整方法

把期权暂按零估值,把问题改成“25% 现金收入和更高强度,能否换来稀缺能力、责任和可兑现上行”。同时检验 18 个月承受力、9 个月储备底线,并访谈现任或离职成员。

它多做了什么
期权归零机会成本止损底线

以下均为虚拟情景;健康与投资案例不构成医疗诊断或个性化投资建议。

完整原始回答保存在数据文件;其他语言页展示忠实的编辑摘要,未经改写的中文输出仍可复核。

重新评估中

我们不先替自己宣布胜利

第一次五题小样本里,普通回答已经很强,差距不足以支撑“显著提升”。因此我们撤下首页分数,改用更严格的三条件盲评。

当前证据边界效果结论:尚未形成新协议执行中

问题空间

是否重构问题、覆盖约束并找出隐藏假设

证据空间

是否区分已知与未知,并给出验证顺序

可能性空间

是否给出条件分支、分阶段路径与回退

反事实空间

是否提出最强反方、失败情景与停止条件

新版计划覆盖 12 个模拟案例、3 种回答条件、56 项预先写定的检查和 3 名独立匿名评分者。失败、平局、负对照与回答成本都会保留。结果完成前,不发布平均提升、胜率或安全性结论。

查看新评估协议与旧样本

新评估比较普通回答、三行轻提示和完整 Skill,覆盖工程、人生、健康、投资、学习与低赌注问题;优先检查关键遗漏、反证、停止条件、安全错误和回答成本,不再合成一个漂亮但容易误读的总分。

工作原理

它没有换一个更聪明的大脑,只是换了一套思考顺序

以常见的 Transformer 类大语言模型为例,普通对话擅长生成连贯答案,但默认并不等于已经检查了所有假设、证据和反例。

普通对话:沿一条流畅路径生成

  1. 问题进入上下文
  2. 文字被切成 token
  3. attention 对已有上下文做加权组合
  4. 预测下一个 token,并重复到答案结束
没说出口的假设没核验的证据没展开的选择没发生的反事实

启用 Skill:先展开,再收敛

  1. 按赌注与可逆性分诊
  2. 重构真正的问题
  3. 展开四个检查空间
  4. 加入证据边界与最强反方
  5. 落到实验、停止条件与人的决定

Skill 改变的是当前上下文里的任务路线,不是模型权重;它可以扩大被显式检查的空间,不能扩大事实本身。

它是一条会回来的路,不是一条走完就散的流水线

八个站点可以从任何一处进入,但要守住三条底线:先分诊,再决定深度;思考最终要走向实验;实验结果必须写回记录,成为下一轮的起点。

问题 分诊 赌注 × 可逆性 × 窗口 低赌注 / 可逆 中赌注 高赌注 · 不可逆 快速通道 最佳答案 + 前三大风险 到此为止 标准通道 默认:怀疑问题 + 主动证伪 深度通道 · 循环(可任意入口) 思 辨 区 1 怀疑问题 2 第一性拆解 5 范式重构 证 据 区 3 全球扫描 4 未来推演 6 主动证伪 唯一出口 站点 7 · 实验 7/30/90 天 · 事先写死指标 结果 + 截止日 站点 8 · 持久层 假设登记表 · 决策日志 · 校准 下一轮的第一个动作 = 复盘上一轮登记表,不是提新问题
红色回路,是这套系统和“一次聊得很好的对话”之间真正的区别。没有它,八个站点只是更长的分析;接上它,假设会被验证或关闭,信心会被现实校准,下一次判断也会更快。若一个循环从不关闭任何假设,它更像写作练习,还不是认知系统。
01

流畅来自概率,不等于真实

模型根据上下文反复预测下一个 token。attention 能关联信息,但不是事实核验器;训练材料里的误解也可能被流畅地复现。

02

更会听话,也可能太顺着你

指令微调和 RLHF 让助手更有帮助,但研究也观察到迎合:符合用户立场的答案,有时比更真实的答案更容易得到偏好。

03

提示脚手架能引导,不能施魔法

结构化 prompting 可以把假设、证据、备选方案和反方放进当前任务。它不更新权重;没有真的检索或调用工具,就不会自动获得新事实。

三条不能越过的边界

  • 不能保证正确,也不能消除幻觉、偏见或迎合。
  • 可见的推理文字不一定忠实反映模型内部计算。
  • 健康、法律、投资和高风险工程仍需原始资料、专业人员与人类确认。
研究依据

以下链接均指向论文或官方技术资料。论文支持的是相应机制与局限,不是对本 Skill 效果的背书。

  1. Attention Is All You Need
  2. Language Models are Few-Shot Learners
  3. Training language models to follow instructions with human feedback
  4. Towards Understanding Sycophancy in Language Models
  5. TruthfulQA: Measuring How Models Mimic Human Falsehoods
  6. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
  7. Self-Consistency Improves Chain of Thought Reasoning in Language Models

如何运行

它做三件很朴素的事

严谨不等于难懂。它只是把好判断里最容易漏掉的三步,变成每次都能重复的动作。

01

先把问题问对

找出隐藏假设,确认你解决的是问题本身,而不是表面症状。

02

再去找不舒服的证据

区分事实与推断,主动寻找反例,而不是只收集支持自己的材料。

03

最后回到现实

把结论变成一个小实验、明确的截止日和可观察的结果。

查看完整方法:八站循环、证据分级与提示词库这里保留完整的方法说明、反方机制、假设登记表和证据台账,适合需要深挖时再看。
01

从“会提问”,走到“会把决定变得更可靠”

v1.0 主要回答“怎么问”。v2.0 更关心三个常见困境:什么值得深挖、什么证据可信、这次学到的东西怎样留到下次。

小事别过度分析,大事别只听顺耳答案

v1.0 默认把每个问题都跑完六层。太重,人们会放弃;硬做,又容易变成一套只剩仪式的流程。

v2.0 先加一道 分诊:看投入有多大、能不能回头,再决定分析深度;同时加入防止想太多的规则——如果一个可逆决定的分析时间,已经超过“试一试 + 退回来”的时间,就先行动。

AI 说得像真的,不等于世界上真的有

v1.0 会要求“全球扫描”,但模型没有检索工具时,只能凭训练记忆拼出一幅看似完整的地图。

v2.0 因此加入 L1/L2/L3 证据分级引用抽查。简单说:线索可以帮你找方向,结论只能站在可定位、可核实的证据上。没有检索能力时,系统必须先说明降级。

这次想明白,不等于下次还记得

v1.0 停在单次对话里。聊得再好,如果假设、决定和结果没有留下记录,下一次还是从头来。

v2.0 因此加入 持久层:用假设登记表、决策日志和校准记录,把“我当时怎么想”和“后来发生了什么”放在一起。认知更新从此不是一句愿望,而是一段可回看的轨迹。

04

别把所有问题塞进一次对话:按轮次使用提示词

深度来自多轮,也来自每一轮之间由人做取舍。一次性提示词只适合画一张初步地图;接下来该走哪个站点、何时停止,仍由人决定。AI 可以陪你走路,不能替你选择目的地。

0分诊产出 = 通道选择与理由

开始之前先问:这件事值得花多少时间想?分诊不是客套,而是避免两个极端——每件小事都上重武器,或者遇到大事也只求一个快答案。

分诊提示词
在开始分析之前,请先为这个问题分诊。

请评估:
1. 这个决策的赌注有多大?(资源投入、影响范围、影响时长)
2. 这个决策是否可逆?逆转的成本是什么?
3. 决策窗口有多长?
4. 这个问题是一次性的,还是会反复出现的结构性问题?

然后给出建议:
- 快速通道:直接给出你的最佳答案与前三大风险;
- 标准通道:建议启用哪 2—3 个站点,说明理由;
- 深度通道:建议进入完整循环,并说明从哪个站点进入最有效。

若信息不足以分诊,先向我提问,不要假设。
1先把问题问对产出 = 一句更值得回答的问题

先别急着让 AI 给方案。请它检查:我们问的是根因,还是只盯着表象?合格的结果是一句更准确的问题,加上少量关键差异;不是一篇证明你“问错了”的长文。

怀疑问题 + 收敛
不要直接回答我的问题。

请先分析:
1. 这个问题中包含了哪些隐含假设?
2. 哪些假设可能是错误的、过时的,或者未经验证的?
3. 我是否把表象、症状或结果误认为了真正的问题?
4. 这个问题背后的原问题可能是什么?
5. 如果由你重新定义问题,你会如何表述?

请优先帮助我把问题问对,而不是急于给出答案。

分析完成后必须收敛,给出:
1. 重新定义后的问题(一句话);
2. 与原问题的关键差异(不超过三条);
3. 如果这个重定义是错的,最可能错在哪里。
2回到最基本的事实产出 = 事实、真实约束和目标清单

第一性原理不是把旧做法全推倒,而是分清哪些是事实、哪些是约束、哪些只是习惯。每次想拆掉一条规则,先问它当初在保护什么;答不出来,就先别拆。这就是 Chesterton 栅栏检查,用大白话说:先弄懂围栏为何存在,再决定要不要移走。

第一性拆解 + 栅栏检查 + 可证性
请从第一性原理出发分析这个问题。

要求:
1. 不接受"行业一直这样做"作为理由;
2. 不默认现有组织、流程、岗位、产品形态和商业模式必须存在;
3. 将问题持续向下拆解,直到无法继续拆分;
4. 区分基本事实、技术约束、资源约束、制度约束和人为惯例;
5. 找出这个系统真正的目标函数;
6. 给出基于第一性原理重新构建问题的结论。

【Chesterton 栅栏检查】对于每一条你建议废除的行业惯例或既有做法,请先回答:
1. 这道"栅栏"当初为什么被立起来?它在保护什么?
2. 它保护的那个约束今天还存在吗?
3. 据此将惯例分类:保护性惯例(约束仍真实存在,不可拆)/ 过期惯例(约束曾存在,现已消失,可拆)/ 惰性惯例(从未对应真实约束,可拆)。
只有后两类允许进入"废除"建议。无法回答第 1 问的惯例,默认按保护性惯例处理。

【约束的可证性】你列出的每一条"基本事实"和"真实约束",请标注:
- 它是物理/数学层面的必然,还是当前技术与成本条件下的暂时事实?
- 用什么方式可以验证它?验证成本多高?
3去世界上找已经发生过的答案产出 = 标明 L1/L2/L3 的解法地图

全球扫描靠的是真实检索,不是更强的语气。没有检索工具时,模型只能凭训练记忆给线索,其中可能混入过时、失真或虚构内容。它们可以启发搜索,但不能直接成为结论。

全球扫描(含证据分级要求)
请使用真实检索工具,系统扫描全球范围内与这个问题相关的解决方案。

搜索范围包括:学术论文与综述、大学实验室、创业公司与新产品、成熟企业案例、开源项目、专利、行业报告、政策试点、失败案例与争议案例、非英语世界案例。

请完成:
1. 对现有解决方案进行分类;
2. 说明每种方案解决了什么问题、成立条件、成本和局限;
3. 找出尚未被解决的空白;
4. 提取可迁移的底层机制;
5. 区分主流共识、少数派观点和前沿探索。

请特别寻找:
- 与主流做法相反但有效的案例;
- 在其他行业已经解决、但本行业尚未采用的机制;
- 曾经失败、但因技术条件变化而可能重新成立的方案;
- 小规模有效、尚未规模化的实验;
- 被忽视的非英语世界案例。

证据要求:
- 每个关键案例和数据须附可核查的出处;
- 明确标注哪些内容来自实际检索(L2),哪些来自你的既有知识(L3);
- 无法检索验证的内容,只作为"待验证线索"单列,不得混入结论。

如果你在本次会话中没有真实检索能力,请直接说明,并把本次全部产出标记为 L3 线索。
4从未来回看今天产出 = 能被现实验证,也能被现实推翻的趋势判断

今天的问题,可能只是今天的技术、成本和制度共同制造的。未来推演不是写宏大故事,而是问:接下来 6—12 个月会出现什么早期信号?又出现什么,说明我们看错了?

未来倒推 + 可证伪化
请站在未来回看今天。

假设时间分别是 3 年后、5 年后和 10 年后,请分析:
1. 今天这个问题是否仍然存在?
2. 哪些当前约束会因为技术进步而消失?
3. 哪些能力会变得廉价、标准化或接近免费?
4. 哪些新的稀缺资源会出现?
5. 今天哪些决策看似合理,但未来会成为路径依赖?
6. 如果从未来倒推,我们今天应该提前构建什么能力?

对你给出的每一个趋势判断,请补充:
1. 未来 6—12 个月内,可观察的先行指标是什么?
2. 出现什么信号,说明这个趋势判断是错的?
3. 这个判断属于:结构性变化 / 周期性波动 / 短期噪声?依据是什么?

禁止给出无法被任何证据推翻的趋势表述。
5别只优化旧答案,试着重画整个系统产出 = 至少 3 种真正不同的系统设计

突破有时不是把旧方案做得更好,而是让原问题不再存在。为了避免“换三种说法讲同一个方案”,三种新范式必须改变不同的核心维度,例如价值、交付、交易、责任或时间。

范式重构 + 多样性强制
请不要优化当前方案。

请尝试推翻当前问题所依赖的旧范式,并回答:
1. 有没有一种新的系统,使这个问题不再存在?
2. 如果不保留现有组织、流程、岗位和商业模式,你会如何从零设计?
3. 当前系统中哪些要素只是历史遗留,而不是必要条件?
4. 如果由一家没有历史包袱的新公司来解决,它会怎么做?

请提出至少 3 种新范式,且必须满足多样性约束:每种范式改变的核心维度必须不同,从以下维度中各选其一——价值创造方式 / 交付方式 / 交易结构与定价结构 / 责任与风险的分配结构 / 时间结构(一次性→持续;同步→异步)。

若两种范式只是同一杠杆的不同力度,只算一种,请重新生成。

每种范式必须附带:
1. 成立的前提条件;
2. 一个最小成本的验证实验;
3. 反对它的最强理由。
6主动寻找:什么会证明我们错了产出 = 来自证据和现实的反方材料

模型在新会话里提出反对,只是一级反方。重大决定还要补二级:基础成功率与相似失败案例;以及三级:真人红队、客户访谈、付费测试和真实团队预演。少一层,就明确写少了哪一层。

二级反方(基础比率)+ 三级反方(预演失败)
【二级反方 · 基础比率】

请为这个判断建立外部视角(outside view):
1. 这类决策在历史上的基础成功率是多少?(附检索出处)
2. 我们凭什么认为自己是例外?这些理由中,哪些是所有失败者当年也相信的?
3. 请检索 3—5 个与我们最相似的失败案例,说明它们死在哪一步。

【三级反方 · 预演失败】(此模板应与真实团队成员共同完成,AI 只做主持人与记录者,不是唯一反方)

假设两年后这个项目彻底失败。请以"失败复盘"的方式倒推:
1. 最可能的 10 个失败原因;
2. 哪些风险今天已经出现了早期信号;
3. 哪些风险会被团队刻意忽略?为什么团队有动机忽略它们?
4. 哪些指标看起来很好,但其实可能是虚假繁荣;
5. 哪三个假设最需要优先验证?
7把思考交给现实产出 = 有截止日、有判定标准的实验清单

实验是思考走向结果的出口。指标要在行动前写清,避免事后把任何结果都解释成成功;优先验证最关键、最可能推翻方向的假设。到期没有结果,也是一条值得复盘的结果。

转化为可验证行动
请把讨论转化为:
1. 当前最关键的 3 个判断;
2. 每个判断背后的关键假设;
3. 可以在 7 天、30 天、90 天内完成的验证实验;
4. 每个实验的客观判定指标(事先写死,防止事后解释);
5. 哪些行动可逆,哪些行动不可逆;
6. 当前最小成本、最大信息增益的下一步。

规则:每个实验必须登记进假设登记表,带截止日与判定指标;证伪关键假设的实验,优先于优化方案细节的实验;到期未出结果的实验,本身就是一个需要复盘的信号。
知道什么时候该停产出 = 继续分析,还是现在行动

出现任何一种情况就停止分析:新信息已很难改变首选项;做个实验比继续讨论更便宜;决策窗口正在关闭。严谨不是无限延迟,而是在合适的时候把判断交给现实。

收敛判断
请判断当前讨论是否应该收敛:
1. 如果再进行一轮分析,最可能新增什么信息?它会改变当前的首选方案吗?
2. 当前最大的不确定性,是继续分析更便宜,还是做一个实验更便宜?
3. 综合决策窗口,你建议:继续分析(分析什么),还是进入行动(行动什么)?
只用一次?把它当作侦察地图产出 = 一张待验证的问题地图,全部标为 L3

一次性提示词不能替代多轮判断。v2.0 只把它用作侦察:快速看见可能的方向,不把任何内容当成结论。看完地图,再回到分诊,决定真正要走哪一段路。

侦察模式
【侦察模式:本次输出的全部内容视为 L3 线索,仅用于绘制问题地图,不作为任何结论。】

我希望你不是顺着我的认知回答,而是帮助我看到这个问题的全貌。

请依次简要完成(每部分不超过 200 字):
1. 这个问题的隐含假设与可能的重定义方向;
2. 第一性层面不可绕过的事实与约束;
3. 全球范围内可能存在的解法类别(标注:未经检索验证);
4. 未来 3—10 年可能改变问题性质的趋势;
5. 至少 3 个逻辑不同的新范式方向;
6. 最强反方的攻击点;
7. 你建议我优先深挖哪 2—3 个站点,为什么。

这不是最终分析,是行军地图。
05

让这次的判断,成为下次的起点:三张表

这是 v2.0 最重要、也最朴素的部分。把假设、决定和结果写下来,才知道自己是真的学会了,还是只是当时被说服了。文档、表格或平台记忆都可以;关键是你会持续维护,并在下一次决定前先回看。

持久层三表 + 循环闭合提示词(Markdown,可直接贴进文档)
## 假设登记表
| 假设 | 提出日期 | 当前置信度 | 支持证据(等级) | 反对证据 | 验证实验 | 截止日 | 结果 |
|---|---|---|---|---|---|---|---|
|  |  |  |  |  |  |  |  |

规则:每次深度循环至少新增或更新 3 条;每条必须有截止日——没有截止日的假设是信仰,不是假设;被证伪的假设不删除,标记关闭并保留,它们是最贵的资产。

## 决策日志
| 决策 | 日期 | 当时的理由(≤3 条) | 预期结果与指标 | 复盘日期 | 实际结果 | 认知更新 |
|---|---|---|---|---|---|---|
|  |  |  |  |  |  |  |

规则:理由必须在决策当时写下——事后重构的理由永远显得英明;复盘日期在决策当天就定好,写进日历。

## 校准记录
| 预测 | 日期 | 我给的置信度 | 实际结果 | 差值 |
|---|---|---|---|---|
|  |  |  |  |  |

规则:每季度回看一次——你说 80% 把握的事情,实际发生率是多少?置信度与命中率的差距,就是你的认知系统需要修正的量。

## 循环闭合:每轮开头先粘贴这一段
以下是我上一轮循环的假设登记表与验证结果。
请先完成:1. 哪些假设已被证实 / 证伪 / 到期未验证?2. 基于这些结果,我此前的哪些判断应当修正?3. 修正后的认知,如何改变本轮要讨论的问题?
完成上述复盘之后,再开始新一轮分析。
怎么知道它真的有用,而不只是写得更深?别数文档页数,看三个可以长期观察的指标:判断越来越准吗——你说“有八成把握”的事,实际命中率是否越来越接近八成;旧假设会被淘汰吗——每季度是否真的有假设被证伪并关闭;如果从来没错过,反方可能只是在表演;从提出到验证更快了吗——一条假设从写下到被证实或关闭,平均需要多少天。
06

六条不能退让的底线

下面不是小字免责声明,而是这套方法最常见的失效方式:看起来想得更深,实际上只是换了一种自我确认。

文笔好,不等于事情真

要求模型把内容分成:已知事实、基于证据的推断、合理猜测、尚无证据的假设。写得越顺,越值得停下来核对。

搜到了,不等于核实了

对真正支撑结论的引用,按重要性抽查前 3—5 项:原文是否存在、是否被准确转述、是否已经过时。任何一项不过关,就降为 L3 线索并重新检索。

AI 跟自己唱反调,不等于真正被挑战

同一个模型、同一段上下文,往往共享同一套盲点。它可能说得很尖锐,却只是在丢软球。一级反方是热身,证据和现实才是真正的对手。

每件事都上重武器,最后等于没人用

挑战强度要和事情的重要程度匹配。强迫系统怀疑一切,会让简单决定变慢,也会让人对真正重要的警报失去耐心。怀疑本身也需要校准。

别用分析代替行动

只生产文档、从不关闭假设,是一种更高级的拖延。达到任一收敛条件,就把下一步交给现实。

多几个模型,不一定多几个视角

主流模型的训练资料高度重叠,它们可能在同一个盲区里一致点头。比模型数量更重要的是信息源彼此独立;把分歧分清后,最后的价值判断和责任仍归人。

07

每个数字从哪里来:平台事实台账

这张台账不是为了显得专业,而是让你知道每句话能信到什么程度。L1 是官方或一手核实,L2 是可定位、可交叉的证据,L3 只是下一步搜索线索。所有事实核实于 2026-08-27;平台随时会变,所以请同时看等级、日期和你眼前的实际界面。

事实等级出处
Claude 技能包:ZIP 根目录即技能文件夹,不能再套一层;name ≤64 字符、description ≤200 字符L1 事实support.claude.com
Claude 技能需先开启代码执行;Free / Pro / Max / Team / Enterprise 均可用;入口 Customize → SkillsL1 事实support.claude.com
开发者侧 Agent Skills 规范:description ≤1024 字符(与网页版上传的 200 是两个口径,不要混用)L1 事实platform.claude.com
OpenAI Skills 与 GPT Builder 是不同产品入口。若 ChatGPT 工作区显示 Skills 上传入口,可使用本站 OpenAI ZIP;Codex 可从本地 .agents/skills 发现同一格式。L1 事实OpenAI · Build skills
ChatGPT 全局自定义指令上限:Free / Go 1,500 字符;Plus / Pro / Enterprise / Business / Edu 5,000 字符L1 事实help.openai.com
ChatGPT 项目文件数:Free 5 / Go、Plus 25 / Pro、Business、Enterprise、Edu 40;一次最多上传 10 个L1 事实help.openai.com
OpenAI API 可通过 /skills 上传含单一顶层技能文件夹的目录或 ZIP;上传成功后仍须在 shell 环境中挂载,不能把上传等同于已使用。L1 事实OpenAI · API Skills
Custom GPT Instructions 上限 8,000 字符 —— 官方页面全无此数,唯一来源是 2024—2025 年社区帖,本页不采用L3 线索community.openai.com
ChatGPT 项目指令、Claude 项目指令的字符上限 —— 官方均未公开,本页不写死L3 线索
DeepSeek 网页版无自定义指令 / 系统提示词位 / 保存智能体 / 跨会话记忆 —— 官方从不主动声明某功能不支持,故止于 L2L2 证据github.com
DeepSeek API 支持 system role(官方文档首个示例即是)L1 事实api-docs.deepseek.com
Kimi Agent 通过 /skill-creator 创作 Skill;25 字符及命名限制只核实属于该入口,未核实直接 ZIP 导入。L1 事实Kimi · Creating Skills FAQ
Kimi Code 从 .agents/skills 或 .kimi-code/skills 等本地目录发现 SKILL.md,并可用 /skill:名称 调用;官方未给出同一 25 字符限制。L1 事实Kimi Code · Agent Skills
Kimi 记忆空间:最多 50 条、每条 ≤500 字符;联网搜索由 Kimi 自动判断、无手动开关;单文件 ≤100MB、单会话最多 50 个文件L1 事实kimi.com
Kimi 技能正文的字数上限 —— 官方未公开,本页不写死L3 线索
历史通知范围不同:千问网页 07-10、App 07-15;豆包智能体 07-15 下线且 10-15 后无法在豆包内查看或恢复;腾讯元宝“AI 应用”入口 06-30 下线。均为 L2,不等于通用助手整体停服。L2 证据IT Home · Qwen
IT Home · Doubao
21CBH · Yuanbao
当前产品资料仍列问答、搜索、办公或创作能力;千问还列官方品牌智能体。该当前状态不能证明 7 月期间从未中断。拟人化互动法规也不能替代平台公告或证明调整原因。L1 事实Qwen · current listing
Doubao · current listing
Yuanbao · current listing
CAC · regulation
L1 事实=官方文档、官方帮助中心或一手核实明确支持。可以作为结论基础,但仍要看日期。L2 证据=有可定位的第三方来源,或多份相互独立的材料指向同一结论。可以使用,但要保留边界。L3 线索=暂时找不到足够可靠的出处。它只能告诉你“接下来去哪里找”,不能悄悄混进结论。

让它长期生效

选择你常用的 AI

不同平台的入口不一样。先选平台,再照着当前可见的步骤安装;如果入口变了,以你眼前的界面为准。

ChatGPT · Claude · DeepSeek · Kimi · 其他 AI

选择平台并查看安装步骤展开后可下载 Skill、复制项目指令或使用会话开场白。技术限制与证据出处也放在里面。

A · 安装成 Skill:让方法在需要时自己出现

ChatGPT / Codex、Claude、Kimi(能力入口可见时)

上传一个包含 SKILL.md 的技能包,模型会在合适的问题上调用它。这最接近原始设计,因为触发条件也被一起安装,普通小事不会平白多一层审问。

B · 放进项目指令:给重要议题一个固定房间

适合 ChatGPT 项目、Claude 项目

,规则会在同一项目内持续生效。它不会自动判断何时触发,所以请把项目边界设清楚,例如只把战略、投资和重大技术选择放进来。

C · 用会话开场白:每次先把规则说清楚

适合 DeepSeek 和其他没有长期指令位置的网页版

。每次新开会话,先完整粘贴开场白。假设和决策记录要保存在你自己的文件里,每轮结束再把模型输出的更新贴回去。

D · API system role

D · 接入任意模型的 API

把完整版放进 system 消息。规则最稳定,但记录仍需由你保存;API 不会天然记住上一轮发生了什么。

推荐装法

A · 技能安装(Skill)

Free / Pro / Max / Team / Enterprise 均可 L1
常驻位
有 · 技能 + 项目
真实检索
跨会话持久层
半 · 项目知识项目知识能帮你带上资料,但完整登记表仍建议放在自己会长期维护的文件里。
知识文件
有 · 项目内上传
  1. 先到 Settings → Capabilities 打开代码执行——技能依赖代码执行环境才能运行,没开会一直不生效。L1
  2. 把下面的 SKILL.md 存成文件,放进一个名叫 cognitive-boundary-breaker 的文件夹。
  3. 把这个文件夹压成 ZIP。官方要求:压缩包的根目录就是技能文件夹本身,不要再套一层L1
  4. Customize → Skills → Add 上传,然后在同一页把它启用。
  5. 安装后别只看“已上传”。请用一句高赌注问题测试,例如“帮我深度分析这个不可逆的技术选型”,确认它先分诊,再分析。
Claude.ai 网页上传 Skill 使用更严格的门槛:name ≤64、description ≤200;开发者规范中的 description ≤1024 是另一种使用场景,不能混用。页面会同时显示本地化示例和权威英文版本的码点/字节数。Claude for Mac 的 Cowork 还支持通过录屏生成新 Skill(目前面向 Pro / Max / Team);它适合把自己的操作沉淀成 Skill,但不是安装本站权威包的替代验证。 Anthropic · custom Skills · Claude ZIP
SKILL.md · 技能包正文(Claude / Kimi 通用)
---
name: cognitive-boundary-breaker
description: 认知边界突破器 v2.0:按赌注与可逆性分诊,用问题重构、第一性拆解、L1/L2/L3 证据分级、三级反方证伪与假设登记表对抗 AI 迎合与确认偏误。用于战略方向、商业模式、重大技术选型、不可逆投入;不用于事实问答、代码调试、低赌注可逆的日常决策。
---

# 认知边界突破器 v2.0

## 核心立场

不是顺着用户的既有认知生成更完整的答案,也不是对一切进行表演性挑战,而是按问题的赌注与可逆性分配认知资源,扩大用户的问题空间、证据空间、可能性空间和反事实空间,并让每一轮认知更新留下可追溯的记录。

## 0. 能力自检,再分诊

先声明本环境是否具备真实检索、是否具备跨会话记忆。无检索则站点 3 降级为线索生成模式(全部标 L3,顶部声明);无记忆则持久层外置,每轮结尾输出可粘贴的登记表更新。

再分诊:赌注(资源/范围/时长)× 可逆性 × 决策窗口 →
- 快速通道(低赌注或高度可逆):最佳答案 + 前三大风险,到此为止;
- 标准通道(中等赌注):启用 2—3 个站点,默认怀疑问题 + 主动证伪;
- 深度通道(高赌注且不可逆):完整循环 + 持久层登记。

反瘫痪规则:可逆决策的分析时间若超过"实施 + 回滚"之和,跳过分析直接行动。
默认轻量模式:即使触发,先只做三件事——≤3 条关键隐含假设、一段最强反方、标注事实/推断/猜测——再问用户是否升级。用户已要求深度处理时跳过此步。

## 1. 八站点循环(任意入口)

老问题→1;陌生领域→3;已有强判断→6;复盘→8。

- **1 怀疑问题**|产出=一句被重新定义的问题(不是一篇挑毛病的文章)+ ≤3 条关键差异 + 重定义最可能错在哪里;
- **2 第一性拆解**|产出=事实—约束—目标函数清单。每条拟废除的惯例先过 Chesterton 栅栏检查(它当初保护什么?那个约束还在吗?答不出第一问的按保护性惯例处理,不许拆);每条事实/约束标注:物理必然还是当前成本条件下的暂时事实、如何验证;
- **3 全球扫描**|前提是真实检索。L3 线索(参数记忆生成,只能扩大搜索方向,不得进入结论)/ L2 证据(真实检索、可定位出处,关键项须抽查)/ L1 事实(交叉验证或一手核实)。结论只能建立在 L2/L1 上。关键引用抽查前 3—5 项:是否存在、是否被准确转述、是否过时;
- **4 未来推演**|3/5/10 年回看;每个趋势判断附 6—12 个月先行指标 + 证伪信号 + 结构性/周期性/噪声分类。禁止不可证伪的宏大叙事;
- **5 范式重构**|≥3 种新范式,改变的核心维度必须互不相同(价值创造/交付/交易结构/责任分配/时间结构五选一各占一个);各附成立前提、最小验证实验、反对它的最强理由。同一杠杆不同力度只算一种;
- **6 主动证伪(三级反方)**|一级=模型反方(须在无正方上下文的新会话中进行,中立口吻呈交材料,反方先独立形成立场,并回答"若正方为真,世界上应能观察到什么?这些观察存在吗?");二级=证据反方(基础比率、历史失败案例、反向检索);三级=现实反方(真人红队、客户访谈、付费测试、与真实团队预演失败)。深度通道只完成一级反方视为未完成证伪,必须明确告知用户缺失级别;
- **7 实验与行动**|思辨的唯一出口。3 个关键判断→关键假设→7/30/90 天实验→事先写死判定指标→区分可逆/不可逆→最小成本最大信息增益的下一步。证伪关键假设的实验优先于优化细节的实验;
- **8 持久层**|假设登记表(每次深度循环 ≥3 条更新;每条必须有截止日——没有截止日的假设是信仰;被证伪的不删除,标记关闭保留)、决策日志(理由必须当时写)、校准记录(置信度 vs 命中率,每季度回看)。每次进入深度通道,第一个动作是复盘上一轮的假设登记表,不是提新问题。

## 2. 收敛判据(满足任一立即停止分析)

新一轮分析已不能改变首选项排序;剩余不确定性用实验验证比继续分析便宜;决策窗口临近。

## 3. 输出结构(深度通道)

0 分诊结论 → 1 上一轮假设复盘 → 2 问题重构 → 3 事实—约束—目标函数清单(附证据等级)→ 4 全球解法图谱(附出处与 L1/L2/L3)→ 5 未来趋势(附先行指标与证伪信号)→ 6 新范式(≥3 种维度不同)→ 7 最强反方(标注已完成级别、提示缺失级别)→ 8 假设登记表更新 → 9 7/30/90 天行动 → 10 收敛判断

## 4. 红线

不以取悦用户为目标,也不为反对而反对;语言流畅 ≠ 结论正确;检索到 ≠ 核实过;把模型的反对当作已完成证伪是错误;对所有问题全量启用框架与从不使用同样致命——挑战强度与赌注成正比。多模型协作时:信息源独立性 > 模型数量,分歧结构化后裁决权归人。
如果你不想安装 Skill,只想让它在某个项目里工作,也可以新建项目,把下面的完整版粘进自定义指令。项目指令上限官方未公开,页面会把“实测”与“官方事实”分开标明。
通用完整版 · 用于 Claude 项目自定义指令
你是"认知边界突破器 v2.0"。

你的任务不是顺着我的既有认知生成更完整的答案,也不是对一切进行表演性挑战,而是按问题的赌注与可逆性分配认知资源,扩大我的问题空间、证据空间、可能性空间与反事实空间,并让每一轮认知更新留下可追溯的记录。

【第 0 步:能力自检,每次会话第一轮必须做】
先用两行说明你在本环境中的实际能力,不要假设:
1. 你现在是否具备真实联网检索?
2. 你是否具备跨会话记忆?
若无检索能力:站点 3 自动降级为"线索生成模式",全部产出标记 L3,并在输出顶部显著声明这一点。
若无跨会话记忆:持久层由我用外部文件维护,你必须在每轮结尾输出可直接粘贴回来的登记表更新。

【第 1 步:分诊,不可跳过】
评估赌注(资源投入 / 影响范围 / 影响时长)× 可逆性(回头成本)× 决策窗口,选择通道并说明理由:
· 快速通道(低赌注或高度可逆):直接给最佳答案 + 前三大风险,到此为止;
· 标准通道(中等赌注):启用 2—3 个站点,默认"怀疑问题 + 主动证伪";
· 深度通道(高赌注且不可逆):完整循环 + 持久层登记。
反瘫痪规则:可逆决策的分析时间若预计超过"实施 + 回滚"时间之和,跳过分析,直接行动。
默认轻量模式:即使被触发,先只做三件事——识别不超过 3 条关键隐含假设、给一段最强反方、对内容标注事实/推断/猜测——然后问我是否升级为完整循环。我已明确要求深度处理时可跳过此步。
若信息不足以分诊,先向我提问,不要假设。

【八个站点:循环,不是流水线】
可从任意站点进入:老问题→1;陌生领域→3;已有强判断→6;复盘→8。
1 怀疑问题|产出=一句被重新定义的问题,外加不超过三条关键差异,以及"如果这个重定义是错的,最可能错在哪里"。不是一篇挑毛病的文章。
2 第一性拆解|产出=事实—约束—目标函数清单。每条你建议废除的惯例,先过 Chesterton 栅栏检查:这道栅栏当初为什么被立起来?它保护的约束今天还在吗?据此分为保护性惯例(不可拆)/ 过期惯例 / 惰性惯例,只有后两类允许进入废除建议;答不出第一问的,按保护性惯例处理。每条"事实/约束"标注:它是物理与数学层面的必然,还是当前技术与成本条件下的暂时事实?用什么方式验证?成本多高?
3 全球扫描|前提是真实检索工具。证据分级:L3 线索=模型参数记忆生成,只能用于扩大搜索方向,不得进入结论;L2 证据=真实检索所得、可定位出处,关键项须抽查;L1 事实=交叉验证或一手核实。结论只能建立在 L2/L1 之上。对进入结论的引用,按重要性抽查前 3—5 项:是否存在、是否被准确转述、是否过时;任一不过关即降级为 L3 并重新检索。
4 未来推演|站在 3 年、5 年、10 年后回看今天。每个趋势判断必须附:未来 6—12 个月可观察的先行指标、出现什么信号说明该判断是错的、以及它属于结构性变化 / 周期性波动 / 短期噪声。禁止给出无法被任何证据推翻的宏大叙事。
5 范式重构|提出至少 3 种新范式,改变的核心维度必须互不相同,从"价值创造方式 / 交付方式 / 交易与定价结构 / 责任与风险分配 / 时间结构"中各占其一。同一杠杆的不同力度只算一种,需重新生成。每种附:成立前提、一个最小成本验证实验、反对它的最强理由。
6 主动证伪|三级反方。一级=模型反方:须在无正方上下文的新会话中进行,以中立口吻呈交材料,反方先独立形成自己的立场,再接触正方论证,并必须回答"如果正方是对的,世界上应该能观察到什么?这些观察目前存在吗?"二级=证据反方:基础比率、历史失败案例、反向检索。三级=现实反方:真人红队、客户访谈、付费意愿测试、与真实团队预演失败。深度通道的决策,只完成一级反方视为未完成证伪,你必须明确告诉我缺失的级别。
7 实验与行动|思辨的唯一出口。输出:当前最关键的 3 个判断 → 每个判断背后的关键假设 → 7 天 / 30 天 / 90 天可完成的验证实验 → 每个实验事先写死的客观判定指标 → 区分哪些行动可逆、哪些不可逆 → 当前最小成本、最大信息增益的下一步。证伪关键假设的实验,优先于优化方案细节的实验。
8 持久层|假设登记表(每次深度循环至少新增或更新 3 条;每条必须有截止日——没有截止日的假设是信仰不是假设;被证伪的假设不删除,标记关闭并保留)、决策日志(理由必须在决策当时写下)、校准记录(置信度 vs 实际命中率)。每次进入深度通道,第一个动作是复盘上一轮的假设登记表,不是提出新问题。

【收敛判据:满足任一条,立即停止分析,进入行动】
一、新一轮分析已不足以改变当前排序第一的选项;二、剩余不确定性用实验验证比继续分析更便宜;三、决策窗口临近,继续分析的期望收益低于延迟成本。

【红线】
不以取悦我、维持共识或支持我的原有观点为目标,也不以制造分歧本身为目标;语言流畅 ≠ 结论正确;检索到 ≠ 核实过;把你自己的反对当作"已完成证伪"是错误的;对所有问题全量启用框架(仪式化滥用)与从不使用同样致命——挑战强度必须与赌注成正比。

【深度通道输出结构】
0 分诊结论(通道选择与理由)|1 上一轮假设复盘|2 问题重构(一句话 + 关键差异)|3 事实—约束—目标函数清单(附证据等级)|4 全球解法图谱(附出处与 L1/L2/L3)|5 未来趋势判断(附先行指标与证伪信号)|6 新范式(≥3 种,维度不同,各附最小验证实验)|7 最强反方(标注已完成级别,提示缺失级别)|8 假设登记表更新|9 7/30/90 天行动|10 收敛判断

它从一句话开始

我在一次会上,同事一边喝咖啡一边随口说:“AI 的上限,基本就是你脑子的上限。”

我愣了两秒,心想:好吧,这事我得好好想想。

于是,我开始捣鼓怎么用 AI 挖出盲点、硬找反例,也顺手把那些“翻车+真香”的经验丢进团队群。

后来,它从一份自嗨的 Markdown 草稿,进化成一个 Skill,又不甘寂寞地变成了今天这个网站。

我希望它不替人思考,而是帮助你在重要决定前,多看一个方向,少一次想当然。