当前位置:首页>Linux>园研讲坛 | Linux实践之 基因家族分析(2026年第6期)

园研讲坛 | Linux实践之 基因家族分析(2026年第6期)

  • 2026-10-11 07:44:18
园研讲坛 | Linux实践之 基因家族分析(2026年第6期)

1

前言

近日,为巩固Linux系统的使用,24级蔬菜班硕士周芯彤同学在本期园研讲坛向大家分享了如何通过Linux系统进行基因家族分析。下面就让我们一起来回顾一下本次讲坛的内容吧。

What is a 

gene family?

什么是

基因家族?

1、来源于同一个祖先,由一个基因通过基因复制而产生两个或更多的拷贝而构成的一组基因。

2、在结构和功能上具有明显的相似性,编码相似的蛋白质产物。

3、同一家族基因可以紧密排列在一起,形成一个基因簇,但多数时候,它们是分散在同一染色体的不同位置,或者存在于不同的染色体上的。

4、各自具有不同的表达调控模式。此外,基因家族具有的特点:

1、位于染色体上不同位置(几乎无重叠)

2、序列高度相似,互为同源基因(即,拷贝数目多于一)。

3、从结构域的角度来说:具有相同保守结构域(某个或多个)的序列,即为某个基因家族的序列(也可能同时要不具有另外的某个结构域)。

如何使用Linux系统进行基因家族分析?

01

选定目标基因家族

02

家族成员鉴定

03

基本理化性质分析

04

功能元件分析

05

进化分析

以拟南芥 WRKY 基因家族为例,周芯彤同学为我们详细讲解了如何利用Linux系统进行分析。

基因家族鉴定的核心思路是:先通过 Hmm 搜索初步筛选,再用 SMART、Pfam 数据库验证保守结构域,最终确定家族成员数量。

实操的第一步是输入数据准备,需要准备两类核心文件:一是物种基因组序列文件(.fa 格式),二是基因结构注释文件(.gff3/.gtf 格式),可从 Ensembl、Phytozome、NCBI 三大数据库下载。

左右滑动查看更多

Hmmer identification of gene families

hmmer 鉴定基因家族

我们先提取保守结构域位置并按设定 E 值阈值完成结果筛选,再用 seqtk 工具截取对应的结构域序列,将序列合并后通过 muscle 进行多序列比对;随后利用比对结果构建物种特异 HMM 模型,开展二次 hmm 搜索以提升基因家族鉴定的准确性,筛选出 E 值<0.001 的结果后获得初步的基因 ID 列表;接着借助 CDD、SMART、Pfam 三大数据库手动验证结构域,剔除假阳性基因,得到最终可靠的基因家族成员列表;之后提取家族成员的蛋白全长与 CDS 序列,完成基本理化性质分析;最后再次通过 muscle 进行多序列比对,用 trimal 修剪掉不保守的序列片段,借助 iqtree2 构建系统进化树,并通过 ggtree 工具完成进化树的可视化呈现。

左右滑动查看更多

整个 Linux 实操流程,从数据准备到最终进化分析,完整实现了基因家族的全流程生信分析,也是我们开展植物基因家族研究的基础技能。

END

图文 | 园艺园林学院

编辑 | 刘泽坤

校对 | 王志远

责编 | 王志远

审核 | 刘昊 谢萌洋

最新文章

随机文章