--- name: scientific-critical-thinking description: 评估科学声明和证据质量。用于评估实验设计有效性、识别偏见和混杂因素、应用证据分级框架(GRADE、Cochrane偏倚风险),或进行批判分析教学。最适合用于理解证据质量、识别缺陷。用于正式同行评审写作请使用peer-review技能。 allowed-tools: Read Write Edit license: MIT license compatibility: Analytical guidance needs no network. Optional figures via the scientific-schematics skill require OPENROUTER_API_KEY and outbound API access to OpenRouter. metadata: {"version": "1.1", "skill-author": "K-Dense Inc."} --- # 科学批判性思维 ## 概述 批判性思维是评估科学严谨性的系统过程。使用GRADE和Cochrane ROB框架评估方法学、实验设计、统计有效性、偏见、混杂和证据质量。应用此技能进行科学声明的批判性分析。 ## 何时使用此技能 当您需要以下操作时,应使用此技能: - 评估研究方法学和实验设计 - 评估统计有效性和证据质量 - 识别研究中的偏见和混杂因素 - 审查科学声明和结论 - 进行系统评价或元分析 - 应用GRADE或Cochrane偏倚风险评估 - 对研究论文进行批判性分析 ## 科学示意图的视觉增强 **使用此技能创建文档时,始终考虑添加科学图表和示意图以增强视觉沟通。** 如果您的文档尚未包含示意图或图表: - 使用**scientific-schematics**技能生成AI驱动的 publication 质量图表 - 只需用自然语言描述您想要的图表 - Nano Banana Pro将自动生成、审查和完善示意图 **对于新文档:** 默认应生成科学示意图,以可视化方式表示文本中描述的关键概念、工作流程、架构或关系。 **如何生成示意图:** ```bash python scripts/generate_schematic.py "your diagram description" -o figures/output.png ``` AI将自动: - 创建具有适当格式的 publication 质量图像 - 通过多次迭代进行审查和完善 - 确保可访问性(色盲友好,高对比度) - 将输出保存在figures/目录中 **何时添加示意图:** - 批判性思维框架图 - 偏见识别决策树 - 证据质量评估流程图 - GRADE评估方法图 - 偏倚风险评估框架 - 有效性评估可视化 - 任何受益于可视化的复杂概念 有关创建示意图的详细指导,请参考scientific-schematics技能文档。 --- ## 核心能力 ### 1. 方法学批判 评估研究方法学的严谨性、有效性和潜在缺陷。 **应用场景:** - 审查研究论文 - 评估实验设计 - 评估研究方案 - 规划新研究 **评估框架:** 1. **研究设计评估** - 设计是否适合研究问题? - 设计能否支持所提出的因果声明? - 对照组是否适当且充分? - 考虑实验、准实验或观察性设计是否合理 2. **有效性分析** - **内部有效性:** 我们能否信任因果推断? - 检查随机化质量 - 评估混杂控制 - 评估选择偏倚 - 审查流失/辍学模式 - **外部有效性:** 结果是否可推广? - 评估样本代表性 - 考虑设置的生态有效性 - 评估条件是否与目标应用匹配 - **构念有效性:** 测量是否捕获了预期构念? - 审查测量验证 - 检查操作定义 - 评估测量是直接的还是代理的 - **统计结论有效性:** 统计推断是否合理? - 验证足够的功率/样本量 - 检查假设符合情况 - 评估测试适当性 3. **控制和盲法** - 随机化是否正确实施(序列生成、分配隐藏)? - 盲法是否可行并已实施(参与者、提供者、评估者)? - 对照条件是否适当(安慰剂、活性对照、无治疗)? - 表现或检测偏倚是否可能影响结果? 4. **测量质量** - 仪器是否经过验证且可靠? - 测量是否尽可能客观,或主观且承认局限性? - 结果评估是否标准化? - 是否使用多种测量来三角测量发现? **参考:** 请参阅`references/scientific_method.md`获取详细原则,以及`references/experimental_design.md`获取综合设计清单。 ### 2. 偏见检测 识别和评估可能扭曲发现的潜在偏见来源。 **应用场景:** - 审查已发表的研究 - 设计新研究 - 解释相互矛盾的证据 - 评估研究质量 **系统性偏见审查:** 1. **认知偏见(研究者)** - **确认偏见:** 是否只强调支持性发现? - **HARKing:** 假设是先验陈述还是在看到结果后形成的? - **发表偏见:** 负面结果是否从文献中缺失? - ** cherry-picking:** 证据是否被选择性报告? - 检查预注册和分析计划透明度 2. **选择偏见** - **抽样偏见:** 样本是否代表目标人群? - **志愿者偏见:** 参与者是否以系统方式自我选择? - **流失偏见:** 组间流失是否有差异? - **生存偏见:** 样本中是否只有"幸存者"可见? - 检查参与者流程图并比较基线特征 3. **测量偏见** - **观察者偏见:** 期望是否可能影响观察? - **回忆偏见:** 回顾性报告是否系统地不准确? - **社会期望:** 反应是否偏向可接受性? - **仪器偏见:** 测量工具是否系统地出错? - 评估盲法、验证和测量客观性 4. **分析偏见** - **P-hacking:** 是否进行了多次分析直到出现显著性? - **结果切换:** 非显著结果是否被显著结果取代? - **选择性报告:** 是否报告了所有计划的分析? - **亚组钓鱼:** 亚组分析是否在未校正的情况下进行? - 检查研究注册并与已发表结果比较 5. **混杂** - 哪些变量可能同时影响暴露和结果? - 混杂因素是否被测量和控制(通过设计或统计方法)? - 未测量的混杂是否可以解释发现? - 是否有合理的替代解释? **参考:** 请参阅`references/common_biases.md`获取带有检测和缓解策略的综合偏见分类。 ### 3. 统计分析评估 批判性评估统计方法、解释和报告。 **应用场景:** - 审查定量研究 - 评估数据驱动的声明 - 评估临床试验结果 - 审查元分析 **统计审查清单:** 1. **样本大小和功率** - 是否进行了先验功率分析? - 样本是否足以检测有意义的效应? - 研究是否功效不足(常见问题)? - 小样本的显著结果是否会引起效应大小膨胀的标志? 2. **统计测试** - 测试是否适合数据类型和分布? - 测试假设是否被检查并满足? - 参数测试是否合理,或应使用非参数替代方案? - 分析是否与研究设计匹配(例如,配对vs独立)? 3. **多重比较** - 是否测试了多个假设? - 是否应用了校正(Bonferroni、FDR等)? - 主要结果是否与次要/探索性结果区分? - 多重测试是否可能导致假阳性发现? 4. **P值解释** - P值是否被正确解释(原假设为真时数据的概率)? - 非显著性是否被错误解释为"无效应"? - 统计显著性是否与实际重要性混淆? - 是否报告了确切的P值,还是仅报告"p < .05"? - 是否有可疑的聚类刚好低于.05? 5. **效应大小和置信区间** - 效应大小是否与显著性一起报告? - 是否提供置信区间以显示精确性? - 效应大小在实际意义上是否有意义? - 标准化效应大小是否在领域特定背景下解释? 6. **缺失数据** - 有多少数据缺失? - 是否考虑了缺失数据机制(MCAR、MAR、MNAR)? - 缺失数据如何处理(删除、插补、最大似然)? - 缺失数据是否可能偏向结果? 7. **回归和建模** - 模型是否过拟合(预测变量过多,无交叉验证)? - 是否在数据范围之外进行预测(外推)? - 多重共线性问题是否得到解决? - 模型假设是否被检查? 8. **常见陷阱** - 相关性被视为因果关系 - 忽略向均值回归 - 基率忽视 - 德克萨斯神枪手谬误(在噪声中寻找模式) - 辛普森悖论(亚组混杂) **参考:** 请参阅`references/statistical_pitfalls.md`获取详细的陷阱和正确做法。 ### 4. 证据质量评估 系统评估证据的强度和质量。 **应用场景:** - 权衡决策证据 - 进行文献综述 - 比较相互矛盾的发现 - 确定结论的信心 **证据评估框架:** 1. **研究设计层次** - 系统评价/元分析(干预效果最高) - 随机对照试验 - 队列研究 - 病例对照研究 - 横断面研究 - 病例系列/报告 - 专家意见(最低) **重要:** 更高层次的设计并不总是质量更好。设计良好的观察性研究可能比执行不良的RCT更强。 2. **设计类型内的质量** - 偏倚风险评估(使用适当工具:Cochrane ROB、Newcastle-Ottawa等) - 方法学严谨性 - 透明度和报告完整性 - 利益冲突 3. **GRADE考虑因素(如适用)** - 从设计类型开始(RCT = 高,观察性 = 低) - **降级因素:** - 偏倚风险 - 研究间不一致 - 间接性(错误的人群/干预/结果) - 不精确性(宽置信区间,小样本) - 发表偏见 - **升级因素:** - 大效应大小 - 剂量-反应关系 - 混杂因素会减少(而非增加)效应 4. **证据收敛** - **更强时:** - 多个独立复制 - 不同研究组和设置 - 不同方法收敛于相同结论 - 机制和经验证据一致 - **更弱时:** - 单一研究或研究组 - 文献中发现相互矛盾 - 发表偏见明显 - 无复制尝试 5. **情境因素** - 生物学/理论合理性 - 与已建立知识的一致性 - 时间性(原因先于效应) - 关系的特异性 - 关联强度 **参考:** 请参阅`references/evidence_hierarchy.md`获取详细层次、GRADE系统和质量评估工具。 ### 5. 逻辑谬误识别 检测和命名科学论证和声明中的逻辑错误。 **应用场景:** - 评估科学声明 - 审查讨论/结论部分 - 评估科普传播 - 识别有缺陷的推理 **科学中常见的谬误:** 1. **因果谬误** - **事后归因:** "B跟随A,所以A导致B" - **相关性=因果关系:** 混淆关联与因果关系 - **反向因果:** 将原因误认为结果 - **单一原因谬误:** 将复杂结果归因于一个因素 2. **概括谬误** - **草率概括:** 从小样本得出广泛结论 - **轶事谬误:** 个人故事作为证明 - ** cherry-picking:** 只选择支持性证据 - **生态谬误:** 将群体模式应用于个人 3. **权威和来源谬误** - **诉诸权威:** "专家说的,所以是真的"(无证据) - **人身攻击:** 攻击人,而非论点 - **遗传谬误:** 按起源判断,而非优点 - **诉诸自然:** "自然=好/安全" 4. **统计谬误** - **基率忽视:** 忽略先验概率 - **德克萨斯神枪手:** 在随机数据中寻找模式 - **多重比较:** 未校正多重测试 - **检察官谬误:** 混淆P(E|H)与P(H|E) 5. **结构谬误** - **虚假二分法:** "要么A要么B",当存在更多选项时 - **移动球门柱:** 达到证据标准后更改标准 - **循环论证:** 循环推理 - **稻草人:** 歪曲论点以攻击它们 6. **科学特定谬误** - **伽利略策略:** "他们嘲笑伽利略,所以我的边缘想法是正确的" - **诉诸无知:** "未被证明为假,所以是真的" - **涅槃谬误:** 拒绝不完美的解决方案 - **不可证伪性:** 提出不可测试的声明 **识别谬误时:** - 命名特定谬误 - 解释推理为何有缺陷 - 确定有效推断所需的证据 - 注意谬误推理并不证明结论为假—只是这个论点不支持它 **参考:** 请参阅`references/logical_fallacies.md`获取带有示例和检测策略的综合谬误目录。 ### 6. 研究设计指导 为规划严谨研究提供建设性指导。 **应用场景:** - 帮助设计新实验 - 规划研究项目 - 审查研究提案 - 改进研究方案 **设计过程:** 1. **研究问题细化** - 确保问题具体、可回答且可证伪 - 验证它解决了文献中的差距或矛盾 - 确认可行性(资源、伦理、时间) - 操作定义变量 2. **设计选择** - 匹配设计到问题(因果→实验;关联→观察) - 考虑可行性和伦理约束 - 在被试间、被试内或混合设计之间选择 - 计划析因设计(如果测试多个因素) 3. **偏见最小化策略** - 尽可能实施随机化 - 计划在所有可行级别实施盲法(参与者、提供者、评估者) - 识别并计划控制混杂因素(随机化、匹配、分层、统计调整) - 标准化所有程序 - 计划最小化流失 4. **样本规划** - 进行先验功率分析(指定预期效应、所需功率、alpha) - 在样本量中考虑流失 - 定义明确的纳入/排除标准 - 考虑招募策略和可行性 - 计划样本代表性 5. **测量策略** - 选择经过验证、可靠的仪器 - 尽可能使用客观测量 - 计划关键构念的多种测量(三角测量) - 确保测量对预期变化敏感 - 建立评分者间可靠性程序 6. **分析规划** - 预先指定所有假设和分析 - 明确指定主要结果 - 计划带有假设检查的统计测试 - 指定如何处理缺失数据 - 计划报告效应大小和置信区间 - 考虑多重比较校正 7. **透明度和严谨性** - 预注册研究和分析计划 - 使用报告指南(CONSORT、STROBE、PRISMA) - 计划报告所有结果,而不仅仅是显著结果 - 区分验证性和探索性分析 - 承诺数据/代码共享 **参考:** 请参阅`references/experimental_design.md`获取覆盖从问题到传播所有阶段的综合设计清单。 ### 7. 声明评估 系统评估科学声明的有效性和支持。 **应用场景:** - 评估论文中的结论 - 评估媒体对研究的报道 - 审查摘要或介绍声明 - 检查数据是否支持结论 **声明评估过程:** 1. **识别声明** - 究竟在声称什么? - 是因果声明、关联声明还是描述性声明? - 声明强度如何(已证明、可能、建议、可能)? 2. **评估证据** - 提供了什么证据? - 证据是直接的还是间接的? - 证据是否足以支持声明的强度? - 替代解释是否被排除? 3. **检查逻辑连接** - 结论是否从数据中得出? - 是否有逻辑跳跃? - 相关数据是否用于支持因果声明? - 局限性是否被承认? 4. **评估比例性** - 信心是否与证据强度成比例? - 对冲词是否被适当使用? - 局限性是否被淡化? - 推测是否被明确标记? 5. **检查过度概括** - 声明是否超出了所研究的样本? - 人口限制是否被承认? - 上下文依赖性是否被认识到? - 是否包含关于概括的警告? 6. **红旗** - 来自相关研究的因果语言 - "证明"或绝对确定性 - 精选引用 - 忽略矛盾证据 - 忽视局限性 - 超出数据的外推 **提供具体反馈:** - 引用有问题的声明 - 解释支持它所需的证据 - 如果需要,建议适当的对冲语言 - 区分数据(发现的内容)和解释(其含义) ## 应用指南 ### 一般方法 1. **保持建设性** - 识别优势和弱点 - 建议改进而非仅仅批评 - 区分致命缺陷和次要局限性 - 认识到所有研究都有局限性 2. **保持具体** - 指向具体实例(例如,"表2显示..."或"在方法部分...") - 引用有问题的陈述 - 提供问题的具体示例 - 参考违反的特定原则或标准 3. **保持比例** - 批评严重程度与问题重要性匹配 - 区分对有效性的主要威胁和次要关注 - 考虑问题是否影响主要结论 - 承认自己评估中的不确定性 4. **应用一致标准** - 对所有研究使用相同标准 - 不对您不喜欢的发现应用更严格的标准 - 承认自己的潜在偏见 - 基于方法学而非结果做出判断 5. **考虑上下文** - 承认实际和伦理约束 - 考虑领域特定的效应大小和方法规范 - 认识到探索性vs验证性上下文 - 在评估研究时考虑资源限制 ### 提供批判时 **反馈结构:** 1. **摘要:** 简要概述评估内容 2. **优势:** 做得好的地方(对可信度和学习很重要) 3. **关注点:** 按严重程度组织的问题 - 关键问题(威胁主要结论的有效性) - 重要问题(影响解释但非致命) - 次要问题(值得注意但不改变结论) 4. **具体建议:** 可操作的改进建议 5. **总体评估:** 关于证据质量和可得出结论的平衡结论 **使用精确术语:** - 命名特定的偏见、谬误和方法学问题 - 参考已建立的标准和指南 - 引用科学方法学的原则 - 准确使用技术术语 ### 不确定时 - **承认不确定性:** "这可能是X或Y;需要的额外信息是Z" - **询问澄清问题:** "[方法学细节]是否完成?这影响解释。" - **提供条件评估:** "如果X完成,则Y随之而来;如果没有,则Z是关注点" - **注意什么额外信息会解决不确定性** ## 参考材料 此技能包括提供批判性评估详细框架的综合参考材料: - **`references/scientific_method.md`** - 科学方法学的核心原则、科学过程、批判性评估标准、科学声明中的红旗、因果推断标准、同行评审和开放科学原则 - **`references/common_biases.md`** - 认知、实验、方法学、统计和分析偏见的综合分类,带有检测和缓解策略 - **`references/statistical_pitfalls.md`** - 常见的统计错误和误解,包括P值误解、多重比较问题、样本量问题、效应大小错误、相关性/因果关系混淆、回归陷阱和元分析问题 - **`references/evidence_hierarchy.md`** - 传统证据层次、GRADE系统、研究质量评估标准、领域特定考虑、证据综合原则和实用决策框架 - **`references/logical_fallacies.md`** - 科学话语中常见的逻辑谬误,按类型组织(因果、概括、权威、相关性、结构、统计),带有示例和检测策略 - **`references/experimental_design.md`** - 综合实验设计清单,涵盖研究问题、假设、研究设计选择、变量、抽样、盲法、随机化、对照组、程序、测量、偏见最小化、数据管理、统计规划、伦理考虑、有效性威胁和报告标准 **何时查阅参考:** - 当需要详细框架时,将参考加载到上下文中 - 使用grep搜索参考中的特定主题:`grep -r "pattern" references/` - 参考提供深度;SKILL.md提供程序指导 - 查阅参考获取综合列表、详细标准和具体示例 ## 记住 **科学批判性思维是关于:** - 使用已建立原则进行系统评估 - 建设性批判,改进科学 - 与证据强度成比例的信心 - 关于不确定性和局限性的透明度 - 标准的一致应用 - 认识到所有研究都有局限性 - 怀疑与对证据开放之间的平衡 **始终区分:** - 数据(观察到的内容)和解释(其含义) - 相关性和因果关系 - 统计显著性和实际重要性 - 探索性和验证性发现 - 已知和不确定的内容 - 反对声明的证据和支持原假设的证据 **批判性思维的目标:** 1. 准确识别优势和弱点 2. 确定支持哪些结论 3. 认识到局限性和不确定性 4. 为未来工作建议改进 5. 推进科学理解