当前位置:首页>python>技能加油包 | 用Python搞定LDA主题模型,文献综述再也不怕"读不完"了!

技能加油包 | 用Python搞定LDA主题模型,文献综述再也不怕"读不完"了!

  • 2026-09-08 14:56:00
技能加油包 | 用Python搞定LDA主题模型,文献综述再也不怕"读不完"了!

📌 引入:为什么药管人也要学LDA?

嗨,各位药管的同学们好呀 👋

不知道大家有没有遇到过这些场景:

  • 📚 导师说"你把这个领域的文献都梳理一遍",你一看,CNKI上搜出来 800+ 篇,一篇篇读怕是要读到毕业……
  • 💬 导师又说"你去看看患者对集采政策的评论",你爬下来 5000 条评论,难道要一条条看?
  • 📜 导师再说"你把近五年药品监管政策文本做个量化分析",你看着 200 份政策文件 陷入沉思……

别慌!今天教大家一个"文本挖掘神器"——LDA主题模型,用 Python 就能跑起来,帮你从海量文本中 自动发现隐藏的主题结构。

简单来说:你给它一堆文档,它告诉你这些文档主要在聊什么。

而且今天这篇教程,不需要你有任何编程基础,代码直接复制粘贴就能运行。走起!🚀


📖 一、LDA原理:30秒搞懂

1.1 一个比喻:图书馆分类 📚

想象你是一个新来的图书管理员,面前有一大堆没有分类标签的书。你怎么把它们分好类?

你的做法可能是这样的:

  1. 翻开每本书,看里面哪些词出现得最多(比如一本书反复出现"成本""效果""医保",那大概率是药物经济学的)
  2. 同一类的书应该有相似的关键词组合(药物经济学的书都爱出现"成本效果""QALY""增量比"这些词)
  3. 反复迭代调整,直到每本书都被归到了最合适的类别

LDA干的就是这个活儿! 只不过它不是人工翻书,而是用概率统计来自动完成这个过程。

1.2 三个核心概念

概念
大白话解释
图书馆比喻
主题(Topic)
一组经常一起出现的词的集合
一个书架/一个分类标签
文档-主题分布
每篇文档由哪些主题组成、各占多少
一本书可能同时涉及两个分类
主题-词分布
每个主题由哪些词构成、各占多少
一个分类下的代表性书籍关键词

1.3 一句话原理

LDA假设每篇文档是由多个主题混合而成的,每个主题又由一组关键词以不同概率构成。通过迭代学习,LDA能同时"反推"出文档的主题分布和主题的关键词分布。

数学上这叫"贝叶斯推断",你暂时不用管公式,先把代码跑起来再说 😄


💻 二、Python实战:手把手教你跑LDA

2.1 环境准备

首先,你需要安装几个 Python 库。打开命令行(Windows 用户按 Win+R 输入 cmd),粘贴以下命令:

pip install gensim jieba pyLDAvis pandas numpy

💡 小提示:如果你还没安装 Python,推荐安装 Anaconda(一个 Python 集成环境),去 Anaconda官网 下载即可,装好后上面的命令在 Anaconda Prompt 里运行。

2.2 完整代码

下面是完整的代码。你不需要改任何东西,直接复制粘贴到一个 .py 文件里运行就行。

代码里用了 30 条模拟的药学文献摘要,涵盖了药物经济学、药品监管、药物警戒、合理用药、药品流通五个方向,所以你可以直接看到五个主题被识别出来。

第一部分:导入库 + 准备数据

# -*- coding: utf-8 -*-"""LDA主题模型 Python实战脚本药管圈 · 技能加油包运行前请先安装依赖:pip install gensim jieba pyLDAvis pandas numpy"""import jiebaimport pandas as pdimport numpy as npfrom gensim import corporafrom gensim.models import LdaModel, CoherenceModelimport pyLDAvisimport pyLDAvis.gensim_models as gensimvis

这段代码做了什么呢?

  • jieba:中文分词工具,把一句话切成一个个词语
  • pandas + numpy:数据处理的基础库
  • gensim:LDA 主题模型的核心库,NLP 领域的瑞士军刀 🔧
  • pyLDAvis:生成漂亮的交互式可视化图

接下来是 30 条模拟药学文献摘要,涵盖五个方向:

# ==================== 1. 构造模拟药学文献摘要 ====================abstracts = [# --- 药物经济学相关 ---"目的:评估某新型抗肿瘤药物的成本效果分析,采用马尔可夫模型进行药物经济学评价,测算质量调整生命年与增量成本效果比。","基于卫生技术评估方法,对三种降压药进行成本效用分析,结果显示新型药物具有较高的经济性,医保支付标准应予以考虑。","本研究运用成本效益分析方法,比较仿制药与原研药在治疗糖尿病中的经济学优势,为药品价格谈判提供循证依据。","通过构建决策树模型,评估免疫检查点抑制剂在非小细胞肺癌治疗中的成本效果,敏感度分析表明结果稳健。","药品集中带量采购政策实施后,对中选药品进行药物经济学再评价,分析价格下降对成本效果比的影响。","采用最小成本分析法比较两种抗感染治疗方案,结合医保目录调整背景讨论药品经济性评价的临床意义。",# --- 药品监管相关 ---"国家药品监督管理局发布新的药品注册管理办法,简化审批流程,加快创新药上市速度,促进医药产业高质量发展。","药品上市许可持有人制度实施效果评价:基于监管数据分析持有人变更情况和药品质量安全责任落实。","仿制药一致性评价政策进展与挑战分析,探讨参比制剂选择、生物等效性试验要求和评价结果应用。","药品审评审批制度改革对创新药研发激励效应的实证研究,分析优先审评和突破性治疗药物程序。","国际药品监管协同机制比较研究,对比FDA、EMA和NMPA在药品加速审批路径上的异同。","药品追溯体系建设与监管创新:基于区块链技术的药品全生命周期监管模式探索。",# --- 药物警戒相关 ---"基于自发报告系统的药品不良反应信号检测方法比较研究,分析比例报告比和贝叶斯方法在信号挖掘中的应用。","某医院药品不良反应监测数据分析:报告类型分布、涉及药品类别和累及器官系统的统计分析。","药物警戒体系下的风险沟通机制研究,探讨药品安全警示信息的发布渠道和公众认知效果。","真实世界数据在药物警戒中的应用:基于电子病历的药品安全信号主动监测方法。","上市后药品安全性再评价:某中药注射剂不良反应文献计量分析与风险因素挖掘。","国际药物警戒信号检测方法学进展:从传统统计学方法到机器学习算法的演变。",# --- 合理用药相关 ---"处方点评制度在促进合理用药中的作用分析:基于某三甲医院抗菌药物专项点评数据的回顾性研究。","临床药师干预对住院患者不合理用药的影响评价,采用前后对照研究设计分析处方合格率变化。","某区域基层医疗机构基本药物合理使用情况调查分析,重点关注处方规范性和用药适宜性。","DRG支付方式改革背景下合理用药管理策略探讨:基于病组用药路径和费用控制的实践。","老年患者多重用药风险评估与管理:基于药物相关性问题和处方精简策略的综述。","抗菌药物分级管理与合理用药:某医院实施分级管理前后抗菌药物使用强度和耐药率变化分析。",# --- 药品流通相关 ---"药品流通供应链管理优化研究:基于冷链物流温控监测数据的药品质量保障分析。","两票制政策对药品流通行业格局的影响:药品批发企业整合趋势与流通效率评价。","互联网药品销售监管问题研究:线上售药平台合规性分析与监管对策建议。","药品集中采购平台运营模式比较与优化路径研究,分析平台功能、采购效率和价格发现机制。","基层药品配送保障机制研究:偏远地区药品可及性与配送及时性影响因素分析。","医药电商发展现状与趋势分析:处方药网售政策放开后的市场格局变化与监管挑战。",]doc_ids = [f"DOC_{i+1:02d}"for i in range(len(abstracts))]

💡 为什么用模拟数据? 这样你不用去找数据就能直接跑通代码。等你学会了方法,把自己的文献摘要替换掉 abstracts 列表就行!

第二部分:添加药学专业术语 + 停用词表

这一步非常关键!因为 jieba 默认的分词词典里可能没有药学专业术语,比如它会把"药物经济学"切成"药物 / 经济学",这就破坏了语义完整性。所以我们要 手动把这些词加进去:

# ==================== 2. 添加专业术语到jieba词典 ====================jieba.add_word("药物经济学")jieba.add_word("药品不良反应")jieba.add_word("集中带量采购")jieba.add_word("上市许可持有人")jieba.add_word("成本效果分析")jieba.add_word("成本效用分析")jieba.add_word("成本效益分析")jieba.add_word("质量调整生命年")jieba.add_word("增量成本效果比")jieba.add_word("马尔可夫模型")jieba.add_word("决策树模型")jieba.add_word("敏感度分析")jieba.add_word("卫生技术评估")jieba.add_word("医保支付标准")jieba.add_word("药品注册管理")jieba.add_word("仿制药一致性评价")jieba.add_word("生物等效性")jieba.add_word("优先审评")jieba.add_word("突破性治疗药物")jieba.add_word("药品追溯体系")jieba.add_word("自发报告系统")jieba.add_word("信号检测")jieba.add_word("药物警戒")jieba.add_word("风险沟通")jieba.add_word("真实世界数据")jieba.add_word("电子病历")jieba.add_word("处方点评")jieba.add_word("合理用药")jieba.add_word("临床药师")jieba.add_word("抗菌药物分级管理")jieba.add_word("多重用药")jieba.add_word("处方精简")jieba.add_word("两票制")jieba.add_word("药品流通")jieba.add_word("冷链物流")jieba.add_word("互联网药品销售")jieba.add_word("药品集中采购")

然后是 停用词表——就是那些"没什么信息量、到处都是"的词,比如"的""了""在"。这些词会干扰模型识别真正的主题关键词,所以要过滤掉:

# ==================== 3. 停用词表 ====================stopwords = set(["的", "了", "在", "是", "和", "与", "对", "为", "及", "以","基于", "通过", "采用", "进行", "分析", "研究", "方法","目的", "结果", "结论", "某", "本研究", "本文", "探讨","比较", "某三甲医院", "某区域", "某医院","并", "或", "等", "从", "到", "中", "上", "下", "后","前", "其", "该", "此", "这些", "那些", "一个","可以", "能够", "应该", "需要", "具有", "存在", "发生","新型", "情况", "变化", "趋势", "影响", "评价", "基于","制度", "实施", "效果", "数据", "相关", "因素", "机制","路径", "体系", "模式", "策略", "现状", "挑战", "进展",])

⚠️ 注意:停用词表里有一些看起来"有用"的词,比如"分析""研究""评价"。这是因为在 LDA 里,这些词几乎 每篇文档都会出现,反而没法区分不同主题,所以要过滤掉。这个思路大家要理解。

接下来是分词函数:

deftokenize(text):"""jieba分词 + 去停用词 + 去单字"""    words = jieba.lcut(text)    words = [w for w in words if len(w) > 1and w notin stopwords]return words

很简单对吧?就是三步:切词 → 去掉停用词 → 去掉单字(单个字的词信息量太低)。

第三部分:计算不同主题数下的Coherence Score

这一步是 选 K(主题数) 的关键。我们不能拍脑袋说"就用5个主题",而是要让数据告诉我们最佳主题数是多少。

怎么判断?用一个叫 Coherence Score 的指标。简单来说,**它衡量的是一个主题里的关键词在语义上有多"连贯"**。分数越高,说明主题内的词越"像是一回事",主题质量越好 🎯

defcompute_coherence_values(dictionary, corpus, texts, limit, start=2, step=1):"""计算不同主题数的Coherence Score"""    coherence_values = []    model_list = []for num_topics in range(start, limit + 1, step):        model = LdaModel(            corpus=corpus,            id2word=dictionary,            num_topics=num_topics,            random_state=42,            passes=20,            iterations=400,            alpha='auto',            eta='auto'        )        model_list.append(model)        coherencemodel = CoherenceModel(            model=model, texts=texts, dictionary=dictionary, coherence='c_v',            processes=1# Windows下用单进程避免multiprocessing报错        )        coherence_values.append(coherencemodel.get_coherence())        print(f"  主题数={num_topics}, Coherence Score={coherencemodel.get_coherence():.4f}")return model_list, coherence_values

💡 Windows 用户注意:processes=1 这行很重要!Windows 下的多进程机制和 Linux 不一样,不改的话可能会报 multiprocessing 相关的错误。

几个参数解释一下:

参数
含义
random_state=42
随机种子,固定后每次运行结果一样,方便复现
passes=20
训练轮数,相当于把所有文档过20遍
iterations=400
每轮的迭代次数
alpha='auto'
文档-主题分布的先验,auto让模型自己学
eta='auto'
主题-词分布的先验,auto让模型自己学

第四部分:主程序——把一切串起来

# ==================== 主程序入口 ====================if __name__ == '__main__':# 分词与预处理    texts = [tokenize(doc) for doc in abstracts]# 构建词典和语料库    dictionary = corpora.Dictionary(texts)    dictionary.filter_extremes(no_below=2, no_above=0.8, keep_n=5000)# 构建Bag-of-Words语料    corpus = [dictionary.doc2bow(text) for text in texts]    print(f"文档数: {len(corpus)}  |  词汇表大小: {len(dictionary)}")    print(f"分词示例(第1篇): {texts[0]}")    print()

这里有几个新概念:

  • Dictionary(词典):把所有出现过的词编号,建一个"词→编号"的映射表
  • filter_extremes:过滤掉太稀有的词(出现不到2次)和太常见的词(超过80%的文档都有),减少噪声
  • doc2bow:把每篇文档转换成"词编号: 词频"的格式,也就是 Bag-of-Words 表示

然后选择最佳主题数:

# ==================== 4. 主题数选择(Coherence Score) ====================    print("=" * 50)    print("计算不同主题数的Coherence Score...")    print("=" * 50)    model_list, coherence_values = compute_coherence_values(        dictionary, corpus, texts, limit=10, start=2, step=1    )    best_idx = np.argmax(coherence_values)    best_k = best_idx + 2# start=2    print(f"\n最佳主题数: {best_k} (Coherence Score={coherence_values[best_idx]:.4f})")    print()

这段代码会从 2 个主题试到 10 个主题,画出"主题数 vs. Coherence Score"的变化趋势。得分最高的那个主题数就是最佳选择。

接下来训练最终的 LDA 模型:

# ==================== 5. 训练最终LDA模型 ====================    K = 5# 选择5个主题(与模拟数据的五个方向对应)    lda_model = LdaModel(        corpus=corpus,        id2word=dictionary,        num_topics=K,        random_state=42,        passes=30,        iterations=500,        alpha='auto',        eta='auto',        chunksize=100,        eval_every=None    )

💡 这里 K=5 是因为我们 事先知道 模拟数据有五个方向。实际使用时,你应该根据上一步 Coherence Score 的结果来决定 K 值。

第五部分:查看结果 + 可视化

# ==================== 6. 查看主题关键词 ====================    print("=" * 50)    print("各主题Top 10关键词:")    print("=" * 50)for idx in range(K):        topic_words = lda_model.show_topic(idx, topn=10)        words_str = ", ".join([f"{w}({p:.3f})"for w, p in topic_words])        print(f"  Topic {idx + 1}: {words_str}")    print()

这一步会输出每个主题的 Top 10 关键词及其权重。你会看到类似这样的结果:

Topic 1: 成本效果(0.035), 马尔可夫(0.030), 药物经济学(0.028), ...Topic 2: 药品注册(0.032), 上市许可(0.029), 仿制药(0.027), ......

这就是 LDA 从文本中"学"出来的主题结构!

# ==================== 7. 文档-主题分布 ====================    print("=" * 50)    print("各文档的主题分布(主导主题):")    print("=" * 50)    doc_topics = []for i, doc_bow in enumerate(corpus):        topic_dist = lda_model.get_document_topics(doc_bow, minimum_probability=0.0)        topic_dist = sorted(topic_dist, key=lambda x: x[1], reverse=True)        dominant_topic = topic_dist[0][0] + 1        doc_topics.append({"Doc": doc_ids[i],"Dominant_Topic": dominant_topic,"Topic_Prob": round(topic_dist[0][1], 4)        })    df_topics = pd.DataFrame(doc_topics)    print(df_topics.to_string(index=False))    print()

这段代码会告诉你:每篇文档最可能被归到哪个主题,以及归属的概率是多少。 比如输出可能长这样:

   DOC_01  Dominant_Topic=1  Topic_Prob=0.82   DOC_07  Dominant_Topic=2  Topic_Prob=0.75

这说明 DOC_01 有 82% 的概率属于主题1(药物经济学),DOC_07 有 75% 的概率属于主题2(药品监管)。

最后,生成漂亮的交互式可视化图:

# ==================== 8. pyLDAvis可视化 ====================try:        print("=" * 50)        print("生成交互式可视化...")        print("=" * 50)        vis_data = gensimvis.prepare(lda_model, corpus, dictionary, n_jobs=1)        output_html = "lda_vis.html"        pyLDAvis.save_html(vis_data, output_html)        print(f"可视化已保存为 {output_html},请在浏览器中打开查看")except Exception as e:        print(f"可视化生成失败(pyLDAvis可能未安装): {e}")        print("可跳过可视化,前面结果已足够参考")    print()    print("运行完毕!")

💡 pyLDAvis 会生成一个 HTML 文件,用浏览器打开就能看到 气泡图——每个气泡代表一个主题,气泡大小代表主题的权重,气泡之间的距离代表主题的相似度。鼠标悬停还能看到每个主题的关键词分布,非常直观!


🔍 三、结果解读:跑出来之后怎么看?

3.1 主题数怎么选?

这是大家最常问的问题。三种方法供参考:

方法
怎么做
适用场景
Coherence Score
代码里已经实现了,看分数拐点
✅ 最推荐,客观量化
肘部法则
画主题数 vs.  perplexity(困惑度)的图,找拐点
辅助参考
业务判断
看主题关键词是否有实际意义
✅ 最终一定要结合专业判断

💡 经验之谈:不要只看 Coherence Score 最高就完事。有时候分数最高的方案,主题关键词看起来"说不通",这时候就应该选一个分数稍低但语义更清晰的方案。数据为业务服务,不是反过来。

3.2 主题怎么命名?

LDA 只会告诉你"主题1的关键词是:成本效果、马尔可夫、药物经济学……",但不会告诉你这个主题叫什么名字。

命名需要你 根据关键词的含义,结合专业知识来概括。比如:

关键词
你的命名
成本效果、马尔可夫、QALY、增量比
→ 药物经济学评价
药品注册、上市许可、仿制药一致性评价
→ 药品监管政策
不良反应、信号检测、药物警戒
→ 药物警戒与安全监测
处方点评、合理用药、临床药师
→ 合理用药管理
冷链物流、两票制、药品流通
→ 药品流通与供应链

⚠️ 注意:命名是一件 需要专业判断 的事情,不同的命名者可能会给出不同的名称,这很正常。关键是命名要 有依据(能对应上关键词),而不是随便起。


⚠️ 四、避坑指南:5个常见坑

根据我自己踩过的坑和同学们反馈的问题,总结了5个最常见的坑:

坑1:分词质量差 💥

现象:主题关键词里出现大量"无意义"的词,或者专业术语被错误切分。

解决:

  • 一定要用 jieba.add_word() 添加专业术语!这是药学文本处理的 第一要务
  • 跑完分词后,先打印几条分词结果 人工检查,确认专业术语没被切碎
  • 可以考虑加载自定义词典文件:jieba.load_userdict("pharma_dict.txt")

坑2:停用词表不完善 💥

现象:主题关键词里全是"研究""分析""方法"这种泛化词汇。

解决:

  • 跑完第一轮后,看看高频词里有没有"看起来没用"的词,有就加进停用词表
  • 停用词表是一个 迭代优化 的过程,不是一次就搞定的
  • 可以参考哈工大停用词表作为基础,再根据自己的领域添加

坑3:主题数 K 选不好 💥

现象:K 太小,所有文档都被归到一两个大杂烩主题里;K 太大,出现很多"只有三四篇文档"的小主题。

解决:

  • 先用 Coherence Score 自动搜索,再 人工检查 每个主题的关键词是否有意义
  • 一般建议 K 在 3-15 之间,太少太多都不太合理
  • 如果数据量小(比如少于100篇),K 不要超过5

坑4:数据量太少 💥

现象:LDA 本质上是统计模型,数据太少(< 50 篇)结果会非常不稳定。

解决:

  • 文献综述场景:至少 100+ 篇 文献摘要
  • 评论分析场景:至少 200+ 条 评论
  • 如果数据实在不够,可以考虑用 BERTopic(基于大语言模型的主题模型),对小数据集更友好

坑5:忽略随机种子的影响 💥

现象:每次跑出来的结果不一样,不知道哪次是"对"的。

解决:

  • **一定要设 random_state=42**(或者任意固定数字),保证结果可复现
  • 如果不确定结果是否稳定,可以换不同的随机种子多跑几次,看主题结构是否一致
  • 代码里已经设了 random_state=42,大家不用改

💊 五、药管应用建议:LDA能用在哪?

作为药管人,LDA 的应用场景其实非常多。下面列5个最常见的方向:

应用场景
数据来源
LDA能做什么
推荐数据量
文献综述辅助
CNKI/PubMed 文献摘要
自动识别研究热点和主题分布,帮你画"研究地图"
100+ 篇摘要
患者评论挖掘
社交媒体/电商平台评论
发现患者最关注的用药问题维度(疗效?副作用?价格?)
200+ 条评论
政策文本分析
政策法规/政府文件
量化分析政策重心的演变趋势(如近十年药品监管政策主题变迁)
50+ 份文件
药品不良反应信号
ADR报告/不良反应数据
从海量ADR报告中自动发现潜在的安全性信号模式
500+ 条报告
课程反馈分析
教学评价/问卷开放题
发现学生对课程的核心关注点和改进方向
100+ 份反馈

🎯 实操建议

  1. 数据获取:CNKI 的摘要可以通过 CNKI 导出功能批量获取(选择"摘要"格式),保存为 txt 或 csv 文件
  2. 替换数据:把代码中的 abstracts 列表替换成你自己的数据就行,其他代码基本不用改
  3. 专业术语词典:每个研究方向的专业术语不一样,记得根据自己的领域调整 jieba.add_word() 的内容
  4. 结果呈现:在论文中展示 LDA 结果时,通常用"主题关键词表 + 主题分布图"的组合,pyLDAvis 的气泡图也可以截图放进去
  5. 结合质性分析:LDA 是量化方法,但它发现的主题结构可以作为你质性分析的"骨架",两者结合更有说服力

📝 六、总结

今天我们学了:

✅ LDA 是什么:一种从文本中自动发现主题结构的统计模型

✅ 怎么用 Python 跑:jieba 分词 + gensim LDA + pyLDAvis 可视化,三步搞定

✅ 结果怎么看:Coherence Score 选 K,关键词语义来命名

✅ 哪些坑要避:分词、停用词、主题数、数据量、随机种子

LDA 不是万能的,但它确实是一个 快速了解大量文本全貌 的好工具。对于做文献综述、政策分析、评论挖掘的药管同学来说,掌握它能帮你省下大量的阅读时间 ⏰

代码直接复制就能跑,不用改任何东西。先把模拟数据跑通,再替换成自己的数据,这就是最高效的学习路径!

如果跑代码过程中遇到问题,欢迎在公众号留言区提问,我们一起交流 💪


📚 参考文献

[1] Blei D M, Ng A Y, Jordan M I. Latent Dirichlet Allocation[J]. Journal of Machine Learning Research, 2003, 3: 993-1022. (LDA 原始论文,经典中的经典) 🔗 http://www.jmlr.org/papers/v3/blei03a.html

[2] Řehůřek R, Sojka P. Software Framework for Topic Modelling with Large Corpora[C]. Proceedings of the LREC 2010 Workshop on New Perspectives for NLP, 2010: 45-50. (gensim 库的作者论文) 🔗 https://radimrehurek.com/gensim/lrec2010_final.pdf

[3] Sievert C, Shirley K. LDAvis: A Method for Visualizing and Interpreting Topics[C]. Proceedings of the Workshop on Interactive Language Learning, Visualization, and Interfaces, 2014: 63-70. (pyLDAvis 可视化方法论文) 🔗 https://nlp.stanford.edu/events/llvi2014/papers/sievert-llvi2014.pdf

[4] Mimno D, Wallach H M, Talley E, et al. Optimizing Semantic Coherence in Topic Models[C]. Proceedings of the 2011 Conference on Empirical Methods in Natural Language Processing, 2011: 262-272. (Coherence Score 的方法论基础) 🔗 https://aclanthology.org/D11-1024/

[5] 孙盟, 等. 主题模型在中文文本分析中的应用研究综述[J]. 情报工程, 2020, 6(2): 71-84. 🔗 https://kns.cnki.net (搜索"主题模型 中文文本分析"可获取)

[6] gensim 官方文档. LDA Topic Modelling. 🔗 https://radimrehurek.com/gensim/auto_examples/tutorials/run_lda.html


免责声明:本文代码和内容为学习交流目的,仅供同学参考学习使用。如有不妥之处,欢迎联系指正。

转载此文请联系我们
或注明转至药管圈♥
作者&编辑:陆成远
责任编辑:彭梓暄

最新文章

随机文章