--- name: hmdb-database description: Access Human Metabolome Database (220K+ metabolites). Search by name/ID/structure, retrieve chemical properties, biomarker data, NMR/MS spectra, pathways, 用于 metabolomics 和 identification. license: HMDB is offered to the public as a freely available resource. Use and re-distribution of the data, in whole or in part, for commercial purposes requires explicit permission of the authors and explicit acknowledgment of the source material (HMDB) and the original publication (see the HMDB citing page). We ask that users who download significant portions of the database cite the HMDB paper in any resulting publications. metadata: skill-author: K-Dense Inc. --- # HMDB数据库 ## 概述 人类代谢组数据库(HMDB)是一个全面的、免费提供的资源,包含在人体内发现的小分子代谢物的详细信息。 ## 何时使用此技能 在进行代谢组学研究、临床化学、生物标志物发现或代谢物鉴定任务时,应使用此技能。 ## 数据库内容 HMDB 5.0版(截至2025年当前版本)包含: - **220,945个代谢物条目**,涵盖水溶性和脂溶性化合物 - **8,610个蛋白质序列**,用于参与代谢的酶和转运蛋白 - **每个代谢物130+个数据字段**,包括: - 化学性质(结构、分子式、分子量、InChI、SMILES) - 临床数据(生物标志物关联、疾病、正常/异常浓度) - 生物学信息(通路、反应、位置) - 光谱数据(NMR、MS、MS-MS光谱) - 外部数据库链接(KEGG、PubChem、MetaCyc、ChEBI、PDB、UniProt、GenBank) ## 核心功能 ### 1. 基于Web的代谢物搜索 通过https://www.hmdb.ca/访问HMDB进行: **文本搜索:** - 按代谢物名称、同义词或标识符(HMDB ID)搜索 - 示例HMDB ID:HMDB0000001、HMDB0001234 - 按疾病关联或通路参与情况搜索 - 按生物样本类型查询(尿液、血清、脑脊液、唾液、粪便、汗液) **基于结构的搜索:** - 使用ChemQuery进行结构和子结构搜索 - 按分子量或分子量范围搜索 - 使用SMILES或InChI字符串查找化合物 **光谱搜索:** - LC-MS光谱匹配 - GC-MS光谱匹配 - 用于代谢物鉴定的NMR光谱搜索 **高级搜索:** - 组合多个条件(名称、性质、浓度范围) - 按生物位置或样本类型过滤 - 按蛋白质/酶关联搜索 ### 2. 访问代谢物信息 检索代谢物数据时,HMDB提供: **化学信息:** - 系统名称、传统名称和同义词 - 化学式和分子量 - 结构表示(2D/3D、SMILES、InChI、MOL文件) - 化学分类和分类学 **生物学背景:** - 代谢通路和反应 - 相关酶和转运蛋白 - 亚细胞位置 - 生物学作用和功能 **临床相关性:** - 生物体液中的正常浓度范围 - 与疾病的生物标志物关联 - 临床意义 - 适用时的毒性信息 **分析数据:** - 实验性和预测性NMR光谱 - MS和MS-MS光谱 - 保留时间和色谱数据 - 用于鉴定的参考峰 ### 3. 可下载数据集 HMDB在https://www.hmdb.ca/downloads提供多种格式的批量数据下载: **可用格式:** - **XML**:完整的代谢物、蛋白质和光谱数据 - **SDF**:用于化学信息学的代谢物结构文件 - **FASTA**:蛋白质和基因序列 - **TXT**:原始光谱峰列表 - **CSV/TSV**:表格数据导出 **数据集类别:** - 所有代谢物或按样本类型过滤 - 蛋白质/酶序列 - 实验性和预测光谱(NMR、GC-MS、MS-MS) - 通路信息 **最佳实践:** - 下载XML格式以获取包含所有字段的全面数据 - 使用SDF格式进行基于结构的分析和化学信息学工作流 - 解析CSV/TSV格式以与数据分析流程集成 - 检查版本日期以确保数据是最新的(当前:v5.0,2023-07-01) **使用要求:** - 学术和非商业研究免费 - 商业使用需要明确许可(联系samackay@ualberta.ca) - 使用数据时引用HMDB出版物 ### 4. 编程API访问 **API可用性:** HMDB不提供公共REST API。编程访问需要联系开发团队: - **学术/研究小组:** 联系eponine@ualberta.ca(Eponine)或samackay@ualberta.ca(Scott) - **商业组织:** 联系samackay@ualberta.ca(Scott)以获取定制API访问 **替代编程访问:** - **R/Bioconductor**:使用`hmdbQuery`包进行基于R的查询 - 安装:`BiocManager::install("hmdbQuery")` - 提供基于HTTP的查询函数 - **下载的数据集**:本地解析XML或CSV文件以进行编程分析 - **Web抓取**:不推荐;联系团队以获取适当的API访问 ### 5. 常见研究工作流 **非靶向代谢组学中的代谢物鉴定:** 1. 从样本中获取实验性MS或NMR光谱 2. 使用HMDB光谱搜索工具与参考光谱匹配 3. 通过检查分子量、保留时间和MS-MS碎裂来验证候选物 4. 审查生物学合理性(预期在样本类型中、已知通路) **生物标志物发现:** 1. 搜索HMDB查找与感兴趣的疾病相关的代谢物 2. 审查正常与疾病状态下的浓度范围 3. 识别具有强烈差异丰度的代谢物 4. 检查通路背景和生物学机制 5. 通过PubMed链接与文献交叉参考 **通路分析:** 1. 从实验数据中识别感兴趣的代谢物 2. 查找每个代谢物的HMDB条目 3. 提取通路关联和酶促反应 4. 使用链接的SMPDB(小分子通路数据库)获取通路图 5. 识别通路富集以进行生物学解释 **数据库集成:** 1. 以XML或CSV格式下载HMDB数据 2. 解析并提取相关字段以构建本地数据库 3. 与外部ID(KEGG、PubChem、ChEBI)链接以进行跨数据库查询 4. 构建包含HMDB参考数据的本地工具或流程 ## 相关HMDB资源 HMDB生态系统包括相关数据库: - **DrugBank**:~2,832个药物化合物及其药物信息 - **T3DB(毒素和毒素靶点数据库)**:~3,670个有毒化合物 - **SMPDB(小分子通路数据库)**:通路图和图谱 - **FooDB**:~70,000个食物成分化合物 这些数据库共享相似的结构和标识符,能够跨人类代谢组、药物、毒素和食物数据库进行集成查询。 ## 最佳实践 **数据质量:** - 使用多种证据类型(光谱、结构、性质)验证代谢物鉴定 - 检查实验性与预测数据质量指标 - 审查生物标志物关联的引用和证据 **版本跟踪:** - 记录研究中使用的HMDB版本(当前:v5.0) - 数据库定期更新,包含新条目和更正 - 发布时重新查询以确保最新信息 **引用:** - 在出版物中始终引用使用数据库的HMDB - 讨论代谢物时引用特定的HMDB ID - 确认下载的数据集的数据源 **性能:** - 对于大规模分析,下载完整数据集而不是重复的Web查询 - 使用适当的文件格式(XML用于全面数据,CSV用于表格分析) - 考虑频繁访问的代谢物信息的本地缓存 ## 参考文档 有关可用数据字段及其含义的详细信息,请参阅`references/hmdb_data_fields.md`。