用批判性思维梳理复杂问题

通过结构化思维框架,显著提升 Claude Code 在复杂决策、系统架构分析及风险预测中的推理质量。

详细介绍

Claude Code Thinking Skills

Claude Code 的 28 种思维模型与批判性思维框架

Claude Code Thinking Skills 是一个包含 28 种思维模型和批判性思维框架的集合,专为 Claude Code 设计。它为 Anthropic 的 AI 编程助手提供了结构化的推理方式,用于决策、调试、系统分析、风险管理和策略规划。每个技能都封装了一个经过验证的思维框架——从第一性原理推理到约束理论——你可以通过名称调用。整个集合基于一个透明、可复现的评估管道。

概览

是什么
一个包含 28 种思维模型和批判性思维技能的库,用于 Claude Code。

适用人群
希望 Claude Code 使用结构化框架而非临时启发式方法进行推理的工程师、创始人和分析师。

如何开始
通过插件市场安装,然后调用 thinking-model-router 来路由到合适的技能。

证据
每个技能都经过可复现的 Elevate-or-Kill 评估管道 测试。诚实的结论是: 目前没有任何技能拥有稳健、可复现的 ELEVATE 判定 ——我们公开了这一结果,而不是隐藏它。

入口
thinking-model-router → 从这里开始

为什么这个项目与众不同

大多数“AI 提示包”仓库声称其内容能让模型更聪明,但从未验证。这个项目反其道而行之:它构建了一个客观、长度可控、可复现的评估工具,并评估了包含 39 个技能的旧版目录。结果被公开记录,包括一个令人不适的发现: 没有任何技能达到可证明、可复现的准确率提升标准。

严谨是关键。这些技能是基于成熟框架的有用结构化推理支架,评估方法足够诚实,能告诉你证据有多强。透明而不是炒作,是这里的标准。

功能特点

28 种思维框架 — 精选的思维模型库,用于决策、调试和策略。

经过评估且诚实 — 通过严格的、可复现的评估管道构建和测试;参见 Elevate-or-Kill 记分卡 。

经过实战检验的基础 — 基于认知科学、系统思维和战略分析中的框架(芒格、梅多斯、卡尼曼、高德拉特、阿奇舒勒/TRIZ、博伊德/OODA)。

原生 Claude Code — 专门为 Claude Code 的技能系统和调用模型设计。

零配置 — 安装后直接通过名称调用技能,无需设置。

可用技能

所有 28 个已发布的技能,按领域分组。元技能 thinking-model-router 是推荐的入口点。

决策与分析

技能
描述
最佳适用场景

thinking-first-principles
将问题分解为基本事实
创新、挑战假设

thinking-second-order
思考超越直接后果的影响
战略决策、政策变更

thinking-pre-mortem
想象失败并逆向推导
项目启动、风险评估

thinking-kepner-tregoe
用于复杂分析的系统化理性过程
高风险决策、根本原因分析

thinking-reversibility
按可逆性分类决策(类型 1/2)
承诺规模、风险评估

thinking-opportunity-cost
评估选择时考虑放弃的东西
资源分配、优先级排序

认知与行为

技能
描述
最佳适用场景

thinking-bounded-rationality
在约束下做出足够好的决策
时间压力、满意化

thinking-socratic
系统化提问框架
需求分析、调试、辅导

thinking-probabilistic
校准的概率估计
预测、不确定性量化

thinking-steel-manning
论证最强的对立立场
辩论、决策验证

系统与策略

技能
描述
最佳适用场景

thinking-systems
分析相互关联的系统
复杂调试、架构设计

thinking-ooda
动态情境下的快速决策
事件响应、竞争场景

thinking-theory-of-constraints
识别并管理瓶颈
性能优化、吞吐量

thinking-cynefin
按复杂性领域分类问题
方法论选择、方法匹配

问题解决与创新

技能
描述
最佳适用场景

thinking-map-territory
识别思维模型的局限性
期望 mismatch、抽象

thinking-circle-of-competence
了解专业知识的边界
委派、学习决策

thinking-triz
解决技术矛盾
工程设计、创新

thinking-five-whys-plus
带偏差防护的增强型根本原因分析
调试、事件事后分析

thinking-scientific-method
假设差分调试
故障定位、模糊症状

thinking-thought-experiment
结构化想象以探索
架构、边界情况、哲学

估算与风险

技能
描述
最佳适用场景

thinking-margin-of-safety
为不确定性建立缓冲
风险管理、系统设计

thinking-lindy-effect
存在时间越长,未来可能持续更久
技术选择、持久性

thinking-via-negativa
通过移除而非增加来改进
简化、健壮性

thinking-red-team
对抗性地攻击自己的计划
安全审查、计划验证

产品与创新

技能
描述
最佳适用场景

thinking-jobs-to-be-done
理解客户雇佣产品完成的工作
产品开发、功能设计

thinking-effectuation
从手段而非目标出发
创业、创新、不确定性

元技能

技能
描述
最佳适用场景

thinking-model-router
从这里开始 – 按领域路由到合适的模型
所有思维技能的入口点

thinking-model-combination
组合多个模型进行更丰富的分析
复杂问题、高风险决策

技能评估方式

对证据的诚实是这个项目的核心特征,因此评估结果被如实报告。

证据基础: 历史覆盖范围不均匀且仍是暂定的。修正后的 portfolio-v1 关卡没有进行任何模型调用,因为功率、数据集和评判校准要求未满足。

主要结论: 目前没有任何技能拥有稳健、可复现的 ELEVATE 判定。 所有 28 个已发布的技能都是仅手动调用的;没有证据证明它们能提高模型准确率。

最接近的历史候选: thinking-scientific-method 在其较大样本量的七月工件中记录了临时的 +4.0pp 故障定位提升。尽管其重新计算的 McNemar 结果显著,但效果低于预先声明的 +5pp 效用阈值,并且该研究存在评分、对照组、分母和原始存档缺陷。它只是方向性证据,而非 ELEVATE。

这对你意味着什么: 将这些技能视为结构化推理支架,而不是保证准确率提升的工具。审计保留了有用的框架,同时将未经支持的性能声明排除在产品之外。

亲自阅读证据:

决策审计 — 目录处置、研究引用和明确的证据缺口。

规范证据注册库 — 机器可读的计数、声明和产品处置权威。

已发布的目录现在包含 28 个技能。在证据支持的切换中,移除了 11 个无支持或重叠的技能;其独特机制被吸收到保留的技能中,历史证据得以保留。

使用方法

安装后,在 Claude Code 中通过名称调用任何技能。如果你不确定哪个框架适合,从 thinking-model-router 开始:

> 使用 thinking-model-router 为这个问题选择合适的框架
> 使用第一性原理思维分析这个架构决策
> 对这个项目计划应用事前验尸框架
> 帮我使用概率推理评估这个假设
> 使用约束理论找到我们的瓶颈

详细技能描述

第一性原理思维

剥离假设,揭示基本事实,然后从基础重新构建解决方案。由埃隆·马斯克倡导,根植于亚里士多德哲学。

何时使用:

常规方法已失败

被告知某事“不可能”

需要创新,而非渐进式改进

概率推理

估计不确定性,用证据更新先验,暴露假设和校准。

何时使用:

估计概率或可能性

解释测试结果或指标

在信息不完整的情况下做决策

系统思维

将问题视为相互关联的整体的一部分,具有反馈回路和涌现特性。对于调试复杂分布式系统至关重要。

何时使用:

调试涉及多个组件

在一个地方修复导致另一个地方出错

行为似乎是涌现的或意外的

约束理论

每个系统恰好有一个约束限制吞吐量。优化其他任何东西都是浪费精力。基于 Eliyahu Goldratt 的工作。

何时使用:

性能优化

流程改进

资源分配

识别瓶颈

科学方法 / 假设差分调试

通过枚举可证伪的假设,按其可能性 × 检查成本排序,并首先进行最便宜的区分性观察,来定位模糊的 bug。这是集合中经过最严格实证检验的技能(最终判定:DIRECTIONAL-NOT-REPLICATED——参见 评估结果 )。

何时使用:

一个症状可能来自多个文件/函数/组件

你现在可以检查代码、日志、差异、跟踪或测试

在应用根本原因分析之前需要定位故障

Cynefin 框架

根据因果关系对问题进行分类:清晰、复杂、复合、混乱。每个领域需要不同的方法。

何时使用:

选择方法论

理解方法失败的原因

危机管理

待完成的工作

客户不购买产品——他们雇佣产品来完成工作。理解工作能解锁创新。

何时使用:

产品开发

功能优先级排序

理解客户行为

红队思维

在对手之前攻击自己的计划。最好的防御是知道自己的弱点。

何时使用:

安全审查

发布前准备

计划压力测试

常见问题

什么是 Claude Code 思维技能?

Claude Code 思维技能是 28 种可重用的思维模型和批判性思维框架,打包为 Claude Code 技能。每个技能为 AI 代理提供一种结构化方法——例如第一性原理推理、概率更新或约束理论——用于分析特定类型的问题。你可以通过名称调用它们,以指导 Claude 在决策、调试和策略中的思考方式。

我应该从哪个思维技能开始?

从 thinking-model-router 开始。它是一个元技能入口点,读取你的问题并路由到最相关的框架,因此你不需要记住所有 28 个。如果你已经知道自己的需求——例如调试、风险或优先级排序——可以直接调用特定技能。

这些技能真的能提高 Claude 的准确率吗?

目前没有任何技能被证明能提高准确率。每个技能都经过可复现的评估, 零技能拥有稳健、可复现的 ELEVATE 判定。 最接近的候选是 thinking-scientific-method ,在其新鲜的首次运行中获得了 +5.3pp(p=0.061,n=150)——方向性但未达到 p<0.05 门槛——且具有显著的 +8.0pp(p=0.001)的可复现性;因为显著的可复现性不能挽回失败的门槛,其判定为 DIRECTIONAL-NOT-REPLICATED。将这些技能视为可靠的结构化推理支架,而不是保证的准确率提升。

模型路由器技能是什么?

thinking-model-router 是一个元技能,充当集合的入口。给定一个问题描述,它识别领域(决策、系统、估计、调试等)并指向最合适的思维框架。它的存在是为了让新手无需研究整个目录就能获得价值。

这些技能基于真实研究吗?

是的。这些框架借鉴了查理·芒格(思维模型)、多内拉·梅多斯(系统思维)、丹尼尔·卡尼曼(双过程认知)、埃利亚胡·高德拉特(约束理论)、根里奇·阿奇舒勒(TRIZ)和约翰·博伊德(OODA 循环)等思想家的成熟工作。除了源理论,这些技能还经过了本项目自己的长度可控、可复现的评估管道,所有结果都发布在 Elevate-or-Kill 记分卡 中。

这些技能免费使用吗?

是的。整个集合根据 MIT 许可证发布,你可以自由使用、修改和分发。

注意事项

这些技能是结构化推理支架,不是保证准确率提升的工具。

目前没有任何技能被证明能提高模型准确率。所有技能都经过评估,但均未达到稳健、可复现的 ELEVATE 判定。

使用前需要通过插件市场安装技能。安装后,通过名称在 Claude Code 中调用。

评估结果公开可用,包括审计和证据注册库。

试试这样做

  • 使用 thinking-model-router 为我当前的架构决策选择最合适的思维框架,并进行分析。
  • 应用 first-principles 技能来拆解并重新评估这个复杂的系统设计方案。
  • 使用 pre-mortem 框架对当前的项目计划进行风险评估,找出潜在的失败点。

作者:tjboudreaux 开发者 / 职场人 | GitHub Stars 873 | 标签:编程开发 项目管理 已认证 开源许可: MIT

来源:colaos.ai | Skill ID:cc-thinking-skills