--- name: epi-data-access description: >- 当用户需要获取流行病学与公共卫生数据、查找疾病负担或疫情公开数据源、下载 国际或中国的公卫统计与监测数据、评估某个数据源能不能用/怎么引用时使用。 同义场景:WHO 数据、GHDx/IHME 疾病负担、Our World in Data、ProMED 疫情快报、 国家卫健委疫情通报、中国 CDC 周报、China CDC Weekly、国家统计局人口数据、 CHNS 队列、发病率/死亡率数据去哪找、疫情数据下载、公卫数据源推荐、 个案数据去标识化、涉及人的数据要不要伦理审查、"帮我找找某地某病的数据"。 argument-hint: '[疾病/指标 + 地区 + 时间范围]' metadata: domains: [epidemiology, public-health] last_reviewed: '2026-08-18' --- # epi-data-access:公共卫生数据源获取规程 ## 目的 流行病学分析的第一公里是"数据从哪来、能不能用、怎么标注"。本技能给出常用 国际与中国公共卫生数据源的获取规程:每个数据源固定回答四件事——**入口、 格式、许可注意、来源标注标签**,并划定个案数据隐私红线与数据只读原则。 铁律(与包根 CLAUDE.md guardrails 一致,此处为域内具体化): 1. 凡写入产物的数据事实必须带来源标签;标签描述出处,不暗示置信度。 2. 数据文件落地即冻结:进 `data/` 后不改名、不编辑、不覆盖(原始数据只读 原则,见 research-workspace)。 3. 个案级数据先过隐私红线检查,再谈分析。 4. 拿不到的数据不编造:留 `[待补证据]` 占位并写明去哪补(evidence-or-silence)。 ## 前置检查 1. 明确需求三要素:**指标**(发病率/死亡率/患病率/疾病负担/病原学监测…)、 **地区**(全球/国家/省级/更小单元)、**时间范围**。三要素不全时先与用户 对齐,不要带着模糊需求逐个试数据源。 2. 确认需要的是**汇总数据**(已按地区/时间聚合的统计量)还是**个案数据** (逐病例记录)。两者走完全不同的合规路径:个案数据必须先完成第 4 节 的隐私与伦理检查。 3. 确认网络环境与访问权限:部分数据源需要注册、申请或机构权限(如 CHNS 需要注册并同意数据使用协议)。无权限的源直接标注"无权限",不要假装能取。 4. 确认工作区已初始化(`data/` 目录存在);未初始化时引导用户先运行 research-workspace。 ## 1 · 国际数据源 以下入口与条款为模型知识整理,**具体 URL 与许可条款可能已变化**:引用前 应打开页面确认当前条款,并把页面所见按 `[模型知识—待核实]` 与实际访问结果 并列呈现(guardrail 第 5 条)。 ### 1.1 WHO 数据(WHO Data / Global Health Observatory) - **入口**:WHO 官网数据页与 Global Health Observatory(GHO)主题指标库 [模型知识—待核实:入口页面近年有过改版]。 - **格式**:网页表格在线浏览;GHO 提供 API(OData 风格)与 CSV 下载 [模型知识—待核实]。 - **许可注意**:WHO 数据通常附带其使用条款,再分发与商用受限;报告中引用 需注明 "World Health Organization" 及获取日期 [模型知识—待核实]。 - **标注标签**:`[WHO-GHO]`(限本会话真实访问到的内容)。 ### 1.2 GHDx / IHME(全球疾病负担研究 GBD) - **入口**:Global Health Data Exchange(ghdx.healthdata.org),GBD 结果 工具(GBD Compare / GBD Results)[模型知识—待核实]。 - **格式**:在线可视化工具 + CSV 下载(需免费注册账号)。 - **许可注意**:IHME 数据免费但要求按指定格式引用 GBD 研究署名;下载时 页面会给出引用文本,照抄即可 [模型知识—待核实]。 - **标注标签**:`[GHDx]`。 - **提示**:GBD 的估计是**模型产出**而非直接观测,写作时应说明"估计值" 属性与不确定区间,不能与监测直报数字混用 [模型知识—待核实]。 ### 1.3 Our World in Data(OWID) - **入口**:ourworldindata.org 各主题页与 Grapher 图表的下载按钮 [模型知识—待核实]。 - **格式**:CSV / 图表导出;多数变量附元数据说明。 - **许可注意**:OWID 自身内容多为 CC-BY,但其**转引的底层数据**(如 WHO、 世界银行)仍受原始来源条款约束——引用时应回溯到底层来源,不能只引 OWID [模型知识—待核实]。 - **标注标签**:`[OWID]`,并同时标注底层来源(如 `[WHO-GHO]`)。 ### 1.4 ProMED 疫情快报 - **入口**:ProMED-mail(promedmail.org),按主题/地区检索疫情通报邮件 [模型知识—待核实]。 - **格式**:非结构化英文快报文本(邮件列表档案)。 - **许可注意**:ProMED 是**早期预警信号**而非核实数据,内容未经同行评议; 引用时必须注明其为未核实通报,并以官方通报复核 [模型知识—待核实]。 - **标注标签**:`[ProMED]`,产物中凡 ProMED 信息均需附"未经官方核实"限定语。 ## 2 · 中国数据源 ### 2.1 国家卫生健康委疫情通报 - **入口**:国家卫健委官网"疫情通报"/法定传染病疫情概况栏目(月度发布) [模型知识—待核实]。 - **格式**:网页文字通报(法定报告传染病分病种发病数、死亡数)。 - **许可注意**:政府公开信息,引用注明发布机构与发布日期;通报数字为 法定报告口径,存在报告延迟与漏报,解读时需说明口径 [模型知识—待核实]。 - **标注标签**:`[国家卫健委]`。 ### 2.2 中国 CDC 周报(China CDC Weekly) - **入口**:weekly.chinacdc.cn,英文周刊,含监测分析、暴发调查简报与方法 文章 [模型知识—待核实]。 - **格式**:网页全文 + PDF,开放获取。 - **许可注意**:开放获取但仍需完整引用(刊名、年卷期、DOI);其"Notes from the Field"类文章是快报性质,引用措辞与正式研究论文区分 [模型知识—待核实]。 - **标注标签**:`[China CDC Weekly]`。 ### 2.3 国家统计局人口数据 - **入口**:国家统计局官网年度统计公报、人口普查/抽样调查公报、国家数据 查询平台 [模型知识—待核实]。 - **格式**:网页表格、公报 PDF;查询平台可导出。 - **许可注意**:政府公开数据;人口分母(计算发病率、粗率必备)注意**口径 年份**——普查年与非普查年的估计方法不同,跨年比较需统一口径 [模型知识—待核实]。 - **标注标签**:`[国家统计局]`。 ### 2.4 CHNS 等队列数据 - **入口**:China Health and Nutrition Survey(CHNS)官网注册申请 [模型知识—待核实];其他常用队列(如 CHARLS、CFPS)各有申请门户 [模型知识—待核实]。 - **格式**:注册审核后下载 SAS/Stata/CSV 数据文件与问卷文档。 - **许可注意**:需签署数据使用协议,通常禁止再分发原始数据、要求按指定 格式致谢;**个案级数据,适用第 4 节全部隐私红线**。 - **标注标签**:`[CHNS]`(或对应队列名)。 ## 3 · 获取与登记规程 按顺序执行: 1. **定口径**:把需求三要素写成一行查询说明(例:"某省 2015–2024 年肺结核 报告发病率,分年度"),据此选择数据源,一次只取一个口径,不混用。 2. **获取**:人工下载或小量 API 调用。批量抓取、镜像整库属 guardrail 第 8 条危险操作(联网批量下载),必须先向用户说明并获确认。 3. **落盘冻结**:原始文件存入 `data/`(建议子目录按来源组织,如 `data/who-gho/`),落地后不再改动。 4. **登记 provenance**:用 provenance-record 登记,note 中 写明:数据源、获取日期(ISO 8601 带时区)、查询条件/URL、文件清单。 5. **记录口径备注**:在该数据的说明文件(如 `data/<源>/README.md`)写明 指标定义、分母来源、已知局限(报告延迟、口径变更),供下游引用。 ## 4 · 隐私红线与伦理审查 凡涉及**个案级数据**(病例一览表、问卷、队列个体记录),在数据进入分析 环境**之前**逐项检查: 1. **去标识化**:姓名、身份证号、电话、详细住址(精细到门牌/自然村)、 工作单位等直接标识符**不得进入分析环境**。确需保留的准标识符(年龄、 性别、乡镇级地区)评估再识别风险,必要时泛化(如年龄分组)。 2. **去标识化在源头做**:在数据整理阶段生成去标识副本,原始含标识符文件 按机构规定单独保管;分析脚本只接触去标识副本。 3. **伦理审查**:涉及人的数据(含回顾性病历、问卷、队列)先确认已有 IRB/伦理委员会批件或豁免证明;没有批件的项目停止数据处理,提醒用户 先办伦理手续。批件编号写入产物的方法学说明。 4. **数据出境**:向境外服务(含在线工具、境外云)传输个案数据前,核对 《数据安全法》《个人信息保护法》及机构数据管理要求与画像中的合规红线; 画像写明"不得出境"的一律拒绝并说明。 5. **最小够用**:只取分析所需的变量与时间范围,不囤数据。 ## 输出模板 获取完成后向用户输出数据源清单: ```markdown ## 数据源清单(<获取日期>) | 数据源 | 指标与口径 | 覆盖范围 | 文件 | 标注标签 | 许可/限制 | | --- | --- | --- | --- | --- | --- | | WHO GHO | 某病发病率(估计值) | 全球,2000–2021 | data/who-gho/xxx.csv | [WHO-GHO] | 需署名 WHO | | 国家卫健委 | 法定传染病报告发病数 | 全国,按月 | data/nhc/xxx.html | [国家卫健委] | 政府公开信息 | - provenance:已登记 .openscience/provenance.jsonl(<记录时间>) - 口径备注:<报告延迟/口径变更/估计值属性…> - 未获得:<指标>(原因:无权限/未发布),[待补证据:建议查 <途径>] - 隐私与伦理:本批为汇总数据,不涉及个案 / 个案数据已去标识化, 伦理批件 <编号>[用户提供] ``` ## 本技能不做什么 - **不做数据质量核验**:数据本身的准确性由发布方负责;本技能只保证来源 可溯、口径写明。发现明显异常时在产物中标注 `[待复核]`,不擅自"修正"。 - **不做批量抓取与镜像**:任何可能触发数据源风控的批量下载均属危险操作, 需用户明确确认(guardrail 第 8 条)。 - **不绕过访问控制**:需注册/申请/付费的数据,只引导用户走正规流程,不 代为伪造申请或共享账号。 - **不做分析**:本技能止于"数据可用且合规地躺在 `data/` 里";描述性分析 交给 outbreak-analysis,空间分析交给 spatial-epi。 - **不评估临床内容**:指标定义拿不准时标 `[模型知识—待核实]` 并建议查 原始文献或咨询领域专家,不编造定义。 ## 收尾与下一步 1. 汇总:取得几个数据源、覆盖哪些指标与年份、哪些需求未满足(含原因)。 2. 指向 `data/` 中的落盘文件与 provenance 记录。 3. 建议下一步: - 暴发/监测数据分析 → `outbreak-analysis`; - 分地区率比较与地图 → `spatial-epi`; - 需要人群分母做标化 → 提醒核对国家统计局口径年份后再进分析。