技能gget
G

gget

对 20+ 个生物信息学数据库进行快速 CLI/Python 查询。用于快速查阅:基因信息、BLAST/BLAT、病毒序列下载、AlphaFold 结构、富集分析、OpenTargets、COSMIC、CELLxGENE,以及 8cube 的小鼠特异性/表达数据。非常适合交互式探索和简单查询。批量处理或进行更高级的 BLAST 使用 biopython;用于多数据库的 Python 工作流则使用 bioservices。

gget - 快速基因组数据库查询工具

技能概述

gget 是一个命令行生物信息学工具和 Python 包,提供对 20+ 基因组数据库和分析方法的统一访问,支持基因信息查询、序列分析、蛋白质结构预测、病毒序列下载、基因富集分析和疾病关联数据检索,适用于交互式探索和简单查询场景。

适用场景

1. 基因发现和序列分析

当您需要快速查找基因信息、获取基因序列、进行序列比对或预测蛋白质结构时,gget 提供了简洁的命令行和 Python 接口。您可以搜索基因、获取详细信息、下载 FASTA 序列、进行 BLAST 搜索,甚至使用 AlphaFold 预测蛋白质结构,所有操作都通过统一的 gget <module> 模式完成。

2. 基因表达和疾病关联分析

研究人员可以使用 gget 快速查询基因在不同组织中的表达模式、找到相关性基因、进行功能富集分析,或者获取疾病和药物关联数据。这对于理解基因功能、识别潜在药物靶点或分析癌症基因组数据特别有用,支持 ARCHS4、Enrichr、OpenTargets、cBioPortal 等多个数据库。

3. 单细胞数据和病毒基因组研究

gget 支持查询 CZI CELLxGENE Discover 单细胞数据库,获取特定基因在细胞类型中的表达数据,同时可以从 NCBI Virus 下载病毒核苷酸序列及相关元数据。这些功能使研究人员能够快速访问现代单细胞数据集和病毒基因组资源,无需复杂的数据处理流程。

核心功能

1. 多数据库统一查询接口

gget 整合了 Ensembl、UniProt、NCBI、RCSB PDB、OpenTargets、ARCHS4、Bgee、COSMIC 等二十多个生物信息学数据库,通过一致的命令行和 Python API 提供基因信息、序列数据、蛋白质结构、表达谱、疾病关联等多种数据。大多数模块同时支持命令行和 Python 函数调用,返回 JSON/CSV 格式(CLI)或 DataFrame/字典(Python),方便集成到不同工作流中。

2. 序列分析和结构预测

提供完整的序列分析工具链,包括 BLAST/BLAT 序列比对、MUSCLE 多序列比对、DIAMOND 快速蛋白质比对、蛋白质结构预测和线性基序预测。特别是 AlphaFold 模块可以预测蛋白质 3D 结构,支持单蛋白和多聚体建模,并能生成可视化结果。这些工具帮助研究人员理解序列相似性、预测分子功能和结构特征。

3. 表达数据与疾病关联检索

支持查询 ARCHS4 基因相关性和组织表达数据、CELLxGENE 单细胞数据库、Enrichr 富集分析,以及 OpenTargets 疾病和药物关联。cBioPortal 模块可以生成癌症基因组热图,COSMIC 模块查询体细胞突变数据库。这些功能使研究人员能够快速获取基因表达模式、功能注释、疾病表型和治疗靶点信息,加速研究假设的生成和验证。

常见问题

gget 和 biopython 有什么区别?什么时候用哪个?

gget 专为快速查询和交互式探索设计,提供简洁的命令行接口来访问多个生物信息学数据库,适合快速获取基因信息、简单序列分析和数据探索。biopython 则更适合批量处理、高级 BLAST 分析和复杂工作流,提供更底层的控制和更丰富的生物信息学功能栈。对于多数据库 Python 工作流,bioservices 可能是更好的选择。

gget 支持哪些 Python 版本?如何安装?

gget 需要 Python ≥ 3.8,建议使用 Python 3.9 或 3.10 以确保与科学计算依赖的兼容性。安装时推荐使用虚拟环境:uv venv .venv && source .venv/bin/activate && uv pip install "gget==0.30.5"。部分模块(如 alphafold、cellxgene、elm)需要额外设置,运行 gget setup <module> 下载依赖。为可重复性,建议固定版本:gget==0.30.5(截至 2026-06-07)。

如何使用 gget 预测蛋白质结构?

首先需要设置依赖:gget setup alphafold(约下载 4GB 模型参数)。然后可以使用 gget alphafold <序列> 预测单蛋白结构,或提供 FASTA 文件预测多聚体。Python 中使用 gget.alphafold("序列", plot=True) 可获得可视化结果。为提高多聚体准确性,建议使用 -mr 20 参数增加回收轮次。预测输出包括 PDB 结构文件、JSON 对齐误差数据和可选的 3D 可视化。