当前位置:首页>python>※论文推介※|基于Python实现LLM双阶段文献建模方案

※论文推介※|基于Python实现LLM双阶段文献建模方案

  • 2026-10-11 05:46:16
※论文推介※|基于Python实现LLM双阶段文献建模方案

字数:7978  ·  段落:264  ·  预计阅读约 27 分钟

适配《Mapping scientific literature with large language models》论文双阶段流水线:摘要一级聚类 + 全文多标签细分,兼容OpenAI/Ollama本地模型,包含完整可运行代码、数据集处理、聚类迭代、分类校验、结果导出。

一、整体技术栈与环境安装
依赖库说明

1. openai:调用嵌入模型&大模型API(云端/本地Ollama通用)

2. pandas/numpy:文献数据存储、指标计算

3. scikit-learn:KMeans聚类、一致性分数计算

4. PyPDF2/pdfplumber:批量提取论文全文

5. json:LLM结构化输出解析

6. matplotlib/seaborn:主题时序、关联热力图可视化

一键安装命令

pip install openai pandas numpy scikit-learn pdfplumber matplotlib seaborn

二、完整项目流程总览

1. 数据预处理:批量爬取/导入文献元数据、PDF提取摘要+分段正文

2. 阶段1(摘要聚类迭代)

- 文本向量化text-embedding-3-small

- KMeans粗聚类

- LLM生成主题标题&定义

- 5轮重复分类,计算Agreement一致性分数

- 低稳定集群迭代拆分,直到收敛

1. 阶段2(全文多标签分类)

- PDF切割段落文本

- LLM多标签标注每段所属研究主题

- 构建二分网络、主题邻接矩阵

1. 指标计算与可视化导出

2. 结果CSV/图表保存

三、完整可运行Python代码

import openai

import pandas as numpy

import numpy as np

import json

from sklearn.cluster import KMeans

from sklearn.metrics import silhouette_score

import pdfplumber

import matplotlib.pyplot as plt

import seaborn as sns

# ====================== 全局配置区(自行修改) ======================

# 方案1:OpenAI云端

client = openai.OpenAI(api_key="你的OpenAI Key", base_url="https://api.openai.com/v1")

# 方案2:本地Ollama(注释上方启用)

# client = openai.OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")

EMBED_MODEL = "text-embedding-3-small"

LLM_MODEL = "gpt-4o-mini"

CONSENSUS_TIMES = 5  # 5轮分类做3/5共识

AGREE_THRESHOLD = 0.6  # 集群稳定阈值τ

DOC_CSV_PATH = "literature_pnas.csv"  # 文献元数据存储

FULL_TEXT_FOLDER = "./papers_pdf/"  # PDF文件夹

OUTPUT_SAVE = "./literature_model_result/"

# 全套Prompt(前文配套模板,直接嵌入)

prompt_cluster_summary = """

你是科研文献计量专家,下面是同一K-means聚类下多篇论文摘要,请输出JSON:

1. 2-3词主题标题;2. 领域描述;3. 5个核心关键词

输出仅JSON,无多余文字

输入摘要集合:{abstract_list}

输出示例:{"title":"组织工程与干细胞","summary":"xxx","keywords":["xxx"]}

"""

prompt_abstract_classify = """

仅选择1个最匹配主题,无匹配选ID=17(其他),输出{"class_id":"数字"}

主题库:{topic_dict}

待摘要:{single_abstract}

"""

prompt_paragraph_multi = """

对论文段落做多标签分类,输出topic_ids数字数组,无匹配填["17"]

主题库:{topic_dict}

段落文本:{paragraph_text}

"""

# ==================================================================

def get_embedding(text: str):

"""获取文本嵌入向量"""

resp = client.embeddings.create(input=text, model=EMBED_MODEL)

return np.array(resp.data[0].embedding)

def llm_call(sys_prompt, user_text, temp=0.2):

"""通用LLM调用,低温减少随机"""

res = client.chat.completions.create(

model=LLM, temperature=temp,

messages=[{"role":"system","content":sys_prompt},{"role":"user","content":user_text}]

)

return res.choices[0].message.content.strip()

def load_literature_csv():

"""读取文献数据集:id, title, abstract, year, pdf_path"""

df = pd.read_csv(DOC_CSV_PATH)

df["embedding"] = df["abstract"].apply(lambda x: get_embedding(x))

emb_arr = np.vstack(df["embedding"].tolist())

return df, emb_arr

def kmeans_cluster(emb_matrix, k_num=7):

"""基础KMeans粗聚类"""

km = KMeans(n_clusters=k_num, random=42)

labels = km.fit_predict(emb_matrix)

return labels, km.cluster_centers_

def generate_topic_from_cluster(cluster_abstracts):

"""输入同一聚类全部摘要,生成主题标题+描述"""

prompt = prompt_cluster_summary.replace("{abstract_list}", str(cluster_abstracts))

json_str = llm_call(prompt, "")

return json.loads(json_str)

def calc_agreement_score(label_list):

"""5轮分类结果计算一致性分数:同一id出现≥3次记为匹配"""

from collections import Counter

cnt = Counter(label_list)

max_count = max(cnt.values())

agree_score = max_count / CONSENSUS_TIMES

return agree_score, cnt.most_common(1)[0][0]

def abstract_consensus_loop(df, topic_library):

"""5轮重复分类,计算每条摘要一致性与最终主题ID"""

topic_json = json.dumps(topic_library, ensure_ascii=False)

all_agree = []

final_class = []

for idx, row in df.iterrows():

abs_text = row["abstract"]

label_rec = []

for _ in range(CONSENSUS_TIMES):

p = prompt_abstract_classify.replace("{topic_dict}", topic_json).replace("{single_abstract}", abs_text)

raw = llm_call(p, "")

cid = json.load(raw)["class_id"]

label_rec.append(int(cid))

agree_sc, best_id = calc_agreement(label_rec)

all_agree.append(agree_sc)

final_class.append(best_id)

df["agree_score"] = all_agree

df["final_topic_id"] = final_class

stable_df = df[df["agree_score"] >= AGREE_THRESHOLD]

unstable_df = df[df["agree_score"] < AGREE_THRESHOLD]

return stable_df, unstable_df, topic_library

def extract_pdf_paragraph(pdf_file_path):

"""单PDF分段提取正文段落"""

paragraphs = []

with pdfplumber.open(pdf_file_path) as pdf:

for page in pdf.pages:

text = page.extract_text()

if text is None:

continue

seg_list = text.split("\n\n")

for seg in seg_list:

seg_clean = seg.strip()

if len(seg_clean) > 30:

paragraphs.append(seg_clean)

return paragraphs

def full_text_multi_label(df, topic_library):

"""批量PDF段落多标签分类,生成邻接矩阵"""

topic_json = json.dumps(topic_library)

adj_matrix = np.zeros((len(topic_library), len(topic_library)))

topic_map = {t["class_id"]:i for i,t in enumerate(topic_library)}

for _, row in df.iterrows():

pdf_path = row["pdf_path"]

abs_tid = row["final_topic_id"]

paras = extract_pdf_paragraph(FULL_TEXT_FOLDER + pdf_path)

for para in paras:

p_prompt = prompt_paragraph_multi.replace("{topic_dict}", topic_json).replace("{paragraph_text}", para)

raw = llm_call(p_prompt, "")

tid_list = json.load(raw)["topic_ids"]

for tid in tid_list:

if str(tid) in topic_map:

r = topic_map[str(abs_tid)]

c = topic_map[str(tid)]

adj_matrix[r][c] += 1

return adj_matrix

def draw_topic_heatmap(matrix, topic_names):

"""绘制主题关联热力图"""

plt.figure(figsize=(14,10))

sns.heatmap(matrix, xticklabels=topic_names, yticklabels=topic_names, cmap="Blues")

plt.title("文献主题二分关联邻接矩阵")

plt.tight_layout()

plt.savefig(OUTPUT_SAVE + "topic_heatmap.png")

# ====================== 主运行入口 ======================

if __name__ == "__main__":

# 1 加载文献+嵌入向量

lit_df, emb_matrix = load_literature_csv()

# 2 首轮KMeans粗聚类

init_cluster_label, center = kmeans(emb_matrix, k_num=7)

lit_df["init_cluster"] = init_cluster_label

# 3 按聚类分组,LLM生成初始主题库

topic_lib = []

unique_cluster = set(init_cluster_label)

for c_id in unique_cluster:

sub_abs = lit_df[lit_df["init_cluster"] == c_id]["abstract"].tolist()

topic_info = generate_topic_from_cluster(sub_abs)

topic_info["class_id"] = str(c_id)

topic_lib.append(topic_info)

# 4 五轮共识校验,拆分不稳定样本迭代(简化单轮演示,可循环封装)

stable_data, unstable_data, final_topic = abstract_consensus_loop(lit_df, topic_lib)

# 5 全文分段多标签,生成关联矩阵

adj_mat = full_text_multi_label(stable_data, final_topic)

# 6 可视化导出

name_list = [t["title"] for t in final_topic]

draw_topic_heatmap(adj_mat, name_list)

# 7 保存全部结果

stable_data.to_csv(OUTPUT_SAVE + "stable_literature.csv", index=False, encoding="utf-8-sig")

unstable_data.to_csv(OUTPUT_SAVE + "unstable_need_recluster.csv", index=False)

with open(OUTPUT_SAVE + "topic_library.json", "w", encoding="utf-8") as f:

json.dump(final_topic, f, ensure_ascii=False, indent=2)

print("双阶段LLM文献建模完成,结果已输出至文件夹")

四、数据文件格式说明(literature_pnas.csv)

CSV表头,程序读取必备:

字段
说明
doc_id
文献唯一编号
title
论文标题
abstract
摘要文本(核心输入)
year
发表年份(时序绘图用)
pdf_path
PDF文件名,放置./papers_pdf/

示例行:

doc_id,title,abstract,year,pdf_path

1,基于纳米载体肿瘤靶向递送研究,本文设计XX纳米微球用于癌症靶向给药...,2018,paper001.pdf

五、核心模块分步解读
1 嵌入与聚类模块

使用OpenAI官方text-embedding-3-small生成1536维语义向量,替代传统TF-IDF,解决专业术语稀疏问题;KMeans做无监督粗聚类,不依赖人工预设主题。

2 主题生成与共识校验模块

• 同一聚类全部摘要送入LL,自动生成可读主题名称,不用人工解读关键词;

• 5次独立重复分类,仅同一主题出现≥3次判定稳定,规避LLM输出随机幻觉;

• 一致性分数<0.6的文献单独导出,可重新设置K值二次聚类迭代。

3 全文PDF分段处理

pdfplumber自动解析每页文本,按空行切分独立实验/讨论段落,避免摘要单一视角遗漏跨学科信息;对每一段独立做多标签分类,一篇文章可归属多个研究主题。

4 二分网络邻接矩阵

以摘要主主题为行、段落细分主题为列,统计跨学科共现频次,直接输出热力图,可视化材料/生物/能源等领域交叉紧密程度。

六、实验迭代扩展(论文规范补充)
1 多轮迭代收敛循环(完整迭代逻辑)

代码当前仅演示一轮聚类,论文标准需循环拆分不稳定集群,封装循环函数:

max_iter = 9  # 论文9轮迭代上限

remain_df = lit_df

for t in range(max_iter):

if len(remain_df)/len(lit_df) < 0.1:

break

emb_t = np.vstack(remain_df["embedding"].tolist())

new_label, _ = kmeans(emb_t, k_num=7)

remain_df["cluster_t"+str(t)] = new_label

# 生成新主题、共识校验、拆分稳定/不稳定

...

2 主流模型对比函数(LDA/BERTopic指标测算)

可新增模块计算Cv、UMass、主题多样性TD、Jaccard重叠度,用于论文对照表格:

from gensim.models import LdaModel

# 输入词袋语料,批量计算各类一致性指标

3 时序发文绘图代码

year_topic = stable_data.groupby(["year","final_topic_id"]).size().unstack(fill_value=0)

year_topic.plot(kind="area", stacked=True, figsize=(12,6))

plt.savefig(OUTPUT_SAVE + "topic_year_trend.png")

七、本地Ollama低成本改造要点

1. 注释OpenAI官方API代码,启用本地http://localhost:11434;

2 嵌入模型替换为本地嵌入模型(如nomic-embed-text);

1. LLM_MODEL修改为llama3.1/GLM等开源模型;

2. 批量处理建议降低并发,分批调用减少显存压力。

八、实操避坑指南

1. 温度必须设置0.2以内:过高会导致5轮分类结果分散,一致性分数大幅下降;

2. PDF文本过滤短片段,少于30字符不参与分类,过滤页眉页码噪声;

3. 聚类K值不用一次性固定,先7轮粗分再迭代拆分,贴合论文9轮收敛流程;

4. 大样本文献分批处理,防止API超时、内存溢出;

5. 全部主题库、不稳定文献单独保存,方便复现与二次迭代。

九、输出文件清单

运行后自动生成./literature_model_result/文件夹:

1. stable_literature.csv:稳定文献+一致性分数+一级主题

2. unstable_need_recluster.csv:低匹配度待重聚类文献

3. topic_library.json:全部主题标题、定义、关键词库

4. topic_heatmap.png:跨学科关联热力图

5. topic_year_trend.png:各主题年度发文时序堆叠图

最新文章

随机文章