技能phylogenetics
P

phylogenetics

使用 MAFFT(多重比对)、IQ-TREE 2(最大似然)和 FastTree(快速 NJ/ML)构建并分析系统发育树。使用 ETE3 或 FigTree 进行可视化。用于进化分析、微生物基因组学、病毒流行动力学、蛋白家族分析以及分子钟研究。

Phylogenetics - 系统发育分析与进化树构建

技能概述

Phylogenetics 技能提供完整的系统发育分析流程,从多序列比对(MAFFT)到最大似然树构建(IQ-TREE 2、FastTree),再到系统发育树可视化(ETE3),帮助您重建生物序列的进化历史。

适用场景

1. 病毒系统发育追踪与疫情溯源

用于追踪病毒传播路径和估计传播时间,例如新冠病毒(SARS-CoV-2)变异株的进化关系分析和疫情传播链重建。通过分子钟分析估算分化时间,为公共卫生决策提供依据。

2. 微生物基因组与物种进化分析

基于 16S rRNA 或核心基因组构建微生物物种系统发育树,用于物种鉴定、亲缘关系分析和种群结构研究。适用于环境微生物学、医学微生物学和宏基因组学研究。

3. 蛋白质家族进化与功能推断

分析蛋白质家族内部的进化关系,识别保守位点、功能分歧和正选择信号。通过系统发育树结合其他功能数据,推断未知蛋白的功能和进化起源。

核心功能

1. 多序列比对与预处理(MAFFT + TrimAl)

使用 MAFFT 进行高质量多序列比对,支持从高精度(linsi/einsi)到超大规模(fftns/auto)的多种模式。集成 TrimAl 进行比对质量控制,自动去除不可靠的比对列,提升后续树构建的准确性。

2. 最大似然树推断(IQ-TREE 2 / FastTree)

IQ-TREE 2 提供自动模型选择(-m TEST)、超快 bootstrap 支持计算(-B 1000)和分子钟分析,适合中小规模数据集(<5000 序列)。FastTree 适用于大规模数据(>1000 序列),速度提升 10-100 倍,同时保持合理的准确性。

3. 系统发育树可视化与分析(ETE3)

基于 ETE3 Python 库进行系统发育树操作、根化(midpoint rooting 或外群根化)、分支修剪和统计计算。支持矩形和圆形树形渲染,可按物种、样本类型等自定义着色,生成出版级可视化图像。

常见问题

系统发育分析需要什么数据格式?

需要 FASTA 格式的序列文件(.fasta.fa.fna),可以是核苷酸序列(.nt)或氨基酸序列(.aa)。序列必须经过质控,去除低质量序列和冗余序列。对于分子钟分析,还需要提供包含样本采集日期的文本文件(dates.txt)。

如何选择 IQ-TREE 和 FastTree?

根据数据规模和需求选择:

  • IQ-TREE 2:<5000 序列,需要高精度、模型自动选择、bootstrap 支持值或分子钟分析
  • FastTree:>1000 序列,需要快速预览或超大规模数据集,时间预算有限
  • 推荐流程:先用 FastTree 快速查看整体结构,再用 IQ-TREE 对关键分支进行精细分析

如何解读系统发育树的 bootstrap 支持?

Bootstrap 支持值表示分支的统计可靠性(0-100):

  • ≥95%:分支高度可信,结果稳健
  • 70-94%:分支中等可信,需谨慎解释
  • <70%:分支可靠性较低,不建议作为结论依据 高 bootstrap 值通常需要足够的序列数量、良好的比对质量和合适的进化模型。如果整体支持值偏低,检查比对质量、增加 bootstrap 重复次数或尝试不同模型。