当前位置:首页>python>组合聚类与优化新利器:基于Python UI的组学数据(转录组、代谢组等)分析框架ECCO

组合聚类与优化新利器:基于Python UI的组学数据(转录组、代谢组等)分析框架ECCO

  • 2026-10-11 06:48:34
组合聚类与优化新利器:基于Python UI的组学数据(转录组、代谢组等)分析框架ECCO

随着多组学(Multi-omics)研究的爆发式增长,研究人员测量的数据量已从几十种分析物飙升至成千上万种 。如何从如此高维、高噪声的数据中准确识别生物学亚型(Endotypes)和底层机制,成为了生信分析的重大挑战 。  

日前,单聚类算法(Mono-cluster solutions)仍是主流,但其固有的算法假设和局限性极易对生物学结论产生误导 。为了解决这一痛点,Montana State University 的 Ronald K. June 团队在 bioRxiv 发表了名为ECCO: A Python UI for Performing Ensemble Clustering Combined with Cluster Optimization on Omics Data的预印本文章 。他们开发了一款名为 ECCO(组合聚类结合聚类优化)的开源 Python 软件,为大尺度组学数据提供了一个无需代码、快速且可扩展的组合聚类框架 。

一、 ECCO 的核心优势

组合聚类(Ensemble Clustering)通过整合多个聚类算法的结果,寻找能稳定聚类在一起的观测值,可显著缓解高维组学数据中的稀疏性和噪声问题 。然而,以往的组合聚类工具(如 diceR 和 clariconc)需要较强的编程能力,未能广泛普及 。

ECCO 带来了以下关键改进:

  1. 零代码操作:提供 Unix/Mac 和 Windows 的独立可执行程序,双击即可运行图形用户界面(UI)。

  2. 高度可定制:仅需修改一个 CSV 配置文件(Specification File),即可自由组合各种相异度指标、联动函数和内部评估指标 。

  3. 多核并行与可扩展性:基于 scipy 和 scikit-learn 构建,支持多线程加速,能随计算资源的增加展现出优异的扩展性 。

  4. 功能全套:内置 24 种功能,涵盖数据预处理、聚类性能评估及下游通路富集分析衔接 。

二、 核心图表与工作流详解

1. ECCO 整体工作流(Figure 1)

文章中的 Figure 1 详细展示了 ECCO 的四步法标准工作流(从左至右):

  • 输入与预处理(左):

Ensemble specifications(组合聚类规范):用户上传一个 CSV 文件,自定义聚类参数 。支持多种相异度或相关性度量(如相关系数、欧氏距离等) ;支持 Ward、Average、Complete、Single 等联动函数(Linkage functions) ;支持三种内部聚类优化指标(轮廓系数 Silhouette、Davies-Bouldin 指标 DBI、Calinski-Harabasz 指标 CH) 。  

Input data & Pre-processing(输入数据与预处理):支持连续、二值或计数数据输入 ,UI 内置了 log10 转换、Auto-scaling(Z-score 标准化)等常见分布调整功能 。  

  • 生成与优化单聚类(中):

Generate cluster solutions:根据规范生成多个独立的凝聚层级聚类方案(M 个方案) 。  

Define optimal number of clusters:自动根据内部指标的评估(例如让平均轮廓系数最接近 1,或使 DBI 最小),为每个单独的方案动态决定最佳的聚类数目($K$ 值) 。  

  • 计算共现共识(中下):

Determine consensus clusters:采用投票共识(Voting Consensus)策略 ,计算任意两个分析物(分子)在所有聚类方案中被划分到同一簇的频率 。其核心公式为:

其中M为方案总数,若分析物i和j在方案m中同簇,则 

否则为 0 。若它们在所有方案中都同簇,权重则为 1 。

  • 评估与输出(右): 

Evaluate & Ensemble cluster solution:自动计算各单聚类方案之间以及其与最终组合聚类方案的 Rand 指数和调整 Rand 指数(Adjusted Rand Index),并输出最终的组合聚类共现矩阵聚类图(Clustergram)和原始数据热图 。

2. 案例分析:代谢组学数据应用(Figure 2)

为了验证 ECCO 的实际效果,作者使用了一组已发表的膝关节滑液代谢组学数据集进行案例分析(共包含 1361 个通过过滤的代谢物特征,本处聚焦于 17 例晚期骨关节炎患者样本) 。在配备 M1 Pro 芯片的 MacBook Pro 上开启 6 个线程,整个 ECCO 流程仅耗时 50 秒 便完成了全部计算并自动保存了 Figure 2 中的图表。

(1) Figure 2A & 2B:单聚类方案的 Rand 与 Adjusted Rand 指数比较

  • 图表设计:这两张图是气泡图(Bubble plots) ,横纵坐标为 6 种不同的单聚类配置组合(结合了不同的相关度量如 CNS/CS、不同的联动函数如 ward/average/complete)。气泡的大小和红色深浅代表指数的高低(越接近 1 气泡越大、颜色越红)。

  • 结果分析:

Figure 2A(Rand 指数):值在 0.31 到 1 之间变动 ,说明各单聚类方案对代谢物的划分存在明显差异(从极小一致到完全一致) 。

Figure 2B(Adjusted Rand 指数):校正了随机相遇概率后,值在 0.04 到 1 之间 。所有值均大于 0,说明各方案的契合度均高于随机预期,表现出了高度的“聚类方案多样性”(Cluster diversity),而这正是提高组合聚类性能的关键基础 。

(2) Figure 2C:单聚类方案与最终组合聚类方案(Ensemble)的比较

  • 结果分析:研究发现,虽然单聚类中的“Complete linkage”方案与最终的 Ensemble 方案表现出较高的相似度(Rand 指数 0.92,Adjusted Rand 指数 0.66) 

  • 科学严谨性反思:作者特别强调,0.92 的 Rand 指数看似很高,但在 1361 个代谢物基数下,这意味着有超过 100 个代谢物的分类在单聚类和组合聚类之间存在分歧。这 100 多个分歧分子足以对下游的“生物学通路富集分析”结果产生颠覆性的影响 。因此,依赖融合了 6 种方案证据的 Ensemble 方案更加稳健 。

(3) Figure 2D:最终组合聚类的共现矩阵图 (Clustergram of Co-occurrence)

  • 图表设计:热图颜色条范围为 0 到 1(0 为白色,1 为明黄色) 。

  • 结果分析:图中清晰可见数个明黄色的方形区域(Squares) 。这直接证明了无论使用哪种单聚类算法组合,这几组代谢物总是雷打不动地聚在一起,它们代表了数据中最为真实、稳健的生物学固有信号 。

(4) Figure 2E:映射回原始表达数据的组合聚类图

  • 图表设计:该热图展示了预处理后的原始代谢物在 17 个样本中的丰度分布,并用黑色虚线框标出了 ECCO 识别出的稳定聚类簇 。

  • 结果分析:例如,在热图的最顶部可以清晰观察到一个特定代谢物簇:在其中 2 例样本中这些代谢物呈现出极高的特异性高表达,而在其余 15 例样本中几乎不表达 。这种敏锐的亚型捕获能力,有助于精准医学中新型疾病内型的发现 。

三、总结与未来展望

作为一款开源、免代码的分析工具,ECCO 成功打破了高阶生信算法与临床/生物学实验科学家之间的壁垒 。

当然,作者也客观指出了系统目前的几点限制,并给出了明确的后续更新计划 :

  • 算法扩展:目前版本专注于凝聚层级聚类,未来将引入 K-means 等非层级算法,并引入 Gap Statistic 等统计学方法来评估聚类的显著性 。

  • 脱离 UI 的 HPC 模式:由于凝聚聚类的计算复杂度为 O(n^3),目前必须在有图形界面的服务器或本地多核运行 。团队计划开发非 UI 的纯命令行流,以便让大型数据更顺畅地跑在高性能计算(HPC)集群上 。

ECCO 代码及程序已完全开源,研究人员可直接从 GitHub 下载对应系统的可执行文件(目前最新版本 v1.0.3),快速提升自己组学数据的聚类可靠性 。

文章链接:

https://www.biorxiv.org/content/10.1101/2022.11.03.515009v2

最新文章

随机文章