技能pathway-enrichment
P

pathway-enrichment

对基因列表或排序后的基因数据运行通路与基因集富集分析,然后解读结果。适用于用户拥有一组基因(来自 PyDESeq2/Scanpy 的差异表达基因、CRISPR 筛选命中、聚类标记基因、蛋白组学命中),并希望了解哪些生物学通路、GO 术语或基因集被过度代表或发生富集。涵盖过度代表性分析(ORA / Enrichr / Fisher / 超几何检验)、排序基因集富集分析(GSEA / preranked)、单样本评分(ssGSEA/GSVA),以及通过 gseapy、g:Profiler、Enrichr 库、MSigDB、GO、KEGG、Reactome 和 WikiPathways 进行功能注释与分析——同时包括基因 ID 映射、选择合适的背景宇宙、多重检验校正、冗余降维、点图/富集图(dotplots/enrichment maps)以及可用于论文发表的表格。用于“通路分析”“富集分析”“GO 富集”“KEGG/Reactome 通路”“GSEA”“过度代表”“功能注释”,或“我的基因分布在哪些通路中”。

Pathway Enrichment - 通路富集分析技能

技能概述

Pathway Enrichment 技能为基因列表和排序基因数据提供全面的通路和基因集富集分析,帮助您理解差异表达基因、CRISPR 筛选命中或聚类标记基因背后的生物学意义。

适用场景

1. 差异表达分析后的功能解读

在完成 DESeq2、edgeR 或 limma 等差异表达分析后,使用本技能识别显著变化的基因富集在哪些生物学通路、GO 术语或基因集中。适用于转录组学、蛋白质组学等各类组学研究。

2. 基因筛选结果的生物学解释

当您拥有一个基因命中列表(如 CRISPR 筛选、ChIP-seq 峰值相关基因、单细胞聚类标记基因)时,本技能可以帮助您发现这些基因共同参与的生物学过程和信号通路。

3. 单细胞和空间转录组学的通路活性评分

使用 ssGSEA 或 GSVA 方法,为每个样本或细胞计算通路活性评分,揭示细胞异质性、发育轨迹或疾病状态相关的通路变化。

核心功能

1. 双方法富集分析(ORA 与 GSEA)

支持超几何检验的过表达分析(ORA)和基于排序基因集的 GSEA 分析,自动根据您的数据类型推荐合适的方法。ORA 适用于明确的基因列表,GSEA 适用于带有统计量的完整基因排序列表,能够检测到更广泛和微妙的生物学信号。

2. 多数据库整合与基因 ID 映射

集成 MSigDB Hallmark、GO Biological Process、KEGG、Reactome、WikiPathways 等主流数据库,通过 gseapy 和 g:Profiler 工具实现自动化分析。内置基因 ID 转换功能,支持 Ensembl、Entrez 等多种 ID 格式到基因符号的映射。

3. 可视化与发表级结果输出

提供丰富的可视化选项,包括点图、条形图、富集地图和 GSEA 运行分数图。自动生成校正后 p 值、FDR、基因重叠信息等发表所需的统计指标,并支持去除冗余 GO 术语,确保结果的可解释性和可发表性。

常见问题

ORA 和 GSEA 应该如何选择?

选择主要取决于您的数据类型。如果您有明确的基因列表(如 padj < 0.05 的差异表达基因、CRISPR 筛选命中基因),使用 ORA 过表达分析;如果您有完整的基因排序列表(每个基因都有统计量或分数),使用 GSEA 或 Preranked GSEA。GSEA 在检测广泛而微妙的效应时更有优势,且无需人为设置阈值。

为什么我的富集分析没有显著结果?

最常见的原因包括:基因 ID 格式不匹配(如使用了 Ensembl ID 但数据库期望基因符号)、背景集设置不当(使用了全基因组而非实际检测到的基因集)、基因列表过短(少于 10 个基因)或过长(超过 2000 个基因导致特异性降低)。建议检查基因 ID 格式、物种设置和背景集定义。

如何处理 GO 富集结果中的冗余术语?

GO 数据库包含大量重叠的术语,直接报告所有显著结果会引入冗余。建议使用富集地图(基于术语间相似度聚类)、前沿基因重叠分析或仅报告父级术语。本技能提供基于 gseapy 的富集地图功能,能够自动识别并合并高度冗余的术语,帮助您选择代表性的生物学过程进行报告。