


01
课程回顾
✦







Part 1
Python和PyCharm介绍及安装
蔡雨恬博士首先回答了Python和PyCharm是什么?通俗地讲,python是用来运行代码的一个软件,而 pycharm 是可以更方便地用 python写代码的软件。随后蔡老师提供了两个软件的安装网址、推荐了相应的安装包,并为大家详细演示了Python和PyCharm的安装与配置过程,以及创建项目、安装第三方库。



Part 2
文本数据获取实战技巧
如何有效获取文本数据是文本分析的重要前提,蔡博士重点介绍“爬取年报”和“筛选年报MD&A文本”两种技巧。蔡雨恬博士先是以“巨潮网年报“为例,详细演示了使用requests模块,从巨潮资讯网爬取上市公司年报PDF文件的全流程,涉及分析网页请求、构造请求头、解析JSON数据、处理文件命名与下载等。接着,蔡老师讲解了如何从下载的PDF年报中提取文字,并依据不同年份年报的章节结构差异,精准定位并截取“管理层讨论与分析”部分的文本,保存为TXT文件,同时生成处理日志供人工核查。通俗地讲,整个筛选文本的处理相当于我们拿到一份 PDF,先判断哪一年,再去读取文本,最终保存TXT文件。



Part 3
文本分析之“词典法”
经过文本数据获取的实战演练后,终于进入了本课程的重头戏“文本分析”。蔡老师结合吴非、赵宸宇、甄红线三篇参考文献中的数字化转型词典,运用“字典法”,读取TXT文件、标准化处理文本、构建关键词列表、实现最长匹配计数算法以避免重复计算,最终输出包含总词频、对数化及每万字词频的统计结果表格,实现了对提取MD&A文本的词频统计。



李哲教授以行业协会举办数字化转型论坛为例,指出词典法在度量数字化转型时存在的“误报”和“漏报”问题,强调结合上下文语义理解的重要性,从而引出更聪明的方法“机器学习”。
李心武博士讲解的Bert模型,就是从“出现了什么词”到“这个词在此处是什么意思”的跃升。他从机器学习视角下的文本分析、机器学习视角下的数字化转型度量两方面展开。首先,李博士概述了机器学习文本分析的分类,强调应根据研究变量选择方法。他详细讲解了BERT模型的双向编码机制及其在理解上下文语义、区分“假阳性”与“假阴性”方面的优势,并阐述了采用BERT度量数字化转型的必要性。




接着,李博士结合代码,逐步演示了年报预训练、语句拆分、标注样本、模型训练的数据处理流程。他推荐采用“候选抽样”与“随机抽样”混合策略构建标注样本集,同时划分训练集、验证集和测试集以微调BERT模型,并使用训练好的模型对全量句子进行预测,输出每句话属于数字化转型的概率,最后生成数字化语句占比、概率加权占比和强度三个核心变量。



课程尾声,李哲教授总结了词典法与机器学习的适用场景,建议根据研究问题的清晰度、数据量及精度要求进行方法选择,并鼓励结合使用。他指出积极学习是一种试错的过程,要保持方法论的谦逊。

学员们求知热情丝毫未减,纷纷抓住收尾环节,积极与授课老师互动交流,蔡雨恬博士耐心回答了大家提出的问题。伴随着热烈充分的互动探讨,本次课程在充盈浓厚的交流氛围中圆满落下帷幕。

02
学习心得
✦
本次课程深度解析了年报MDA文本提取与BERT模型应用,为推进“双数字化”与企业财务风险防范的研究项目提供了关键的技术支撑。在财务实证分析中,传统词频法极易陷入“假阳性”或“假阴性”的误区,而BERT基于多层Transformer的动态语境识别,精准解决了识别主体与真实状态的痛点。
在后续的技术路线上,我将严格借鉴课程中的“候选与随机混合抽样”及双人盲审策略,把控底层标注数据的质量。在评估模型度量指标时,应当扎实开展稳健性检验(Robustness Analysis),综合对比二元占比、概率加权等多种指标聚合方式,不盲目追求复杂算法,而是踏实打磨高质量的工作论文和研究报告。
此外,长达数月的脏数据清洗过程也提醒我,规范的前期文本处理是智能财务分析的基石。这次学习让我深刻认同“先定义变量,再匹配模型”的学术思维,未来我将努力把这一套语义度量框架更深入地融入到财务风控与实证探索中。
——哈尔滨商业大学刘婧文
这次系统学习年报文本量化分析全套实操流程,收获颇丰。
我理解了PDF年报提取MDA文本、词典法构建数字化转型指标、BERT语义模型训练全流程代码操作,厘清了传统词频方法与预训练模型的优劣差异。课程从数据爬取、文本清洗、人工标注,到模型训练、批量预测、企业年度指标聚合层层递进,让我理清实证文本研究完整逻辑。
同时我认识到,词典法易出现误判,BERT依托上下文语义测算更精准,且标注质量、阈值选择、分组划分都会直接影响结果可靠性。
作为一个初学者,只听课不实操也无法真正掌握python的应用。后续我会复现整套代码,亲身实践运行代码,将文本分析方法运用到自身实证研究中。并且反复观看课程回放,理解其中的深层道理,相信回顾重复练习后会有更大的收获!
——石河子大学国婧
今日完整学习《Python文本分析 机器学习综合案例——数字化转型》专题课程,收获颇丰。
李哲教授结合实证会计研究场景实操授课,完整演示Python环境搭建、巨潮年报爬取、MDA文本筛选全流程操作,清晰讲解词典法文本量化思路,直观掌握传统文本量化工具在财务研究中的落地路径。
课堂上系统拆解BERT预训练模型完整应用链路,从财报领域语料预训练、文本分句处理、双人混合抽样标注,到模型微调、全量文本阈值预测,层层拆解自然语言处理落地财报文本的完整步骤,弥补了我只懂理论、缺乏实操流程的短板。
本次课程厘清了词典法与机器学习模型的适用边界,也建立起严谨的文本指标构建规范。后续我将依照课程案例复现完整代码,动手复现年报文本量化流程,把文本分析方法融入自身会计实证研究,夯实量化研究实操功底。
——北京信息科技大学薛亦菲
今天系统梳理了文本分析两大方法,理清词典法与机器学习的演进逻辑。词典法依托关键词统计词频,最长匹配计数提醒我实操要规避重复计算问题;机器学习从TF-IDF到BERT,依靠双向语境解决多义词,但微调、长文本处理仍需代码实操练习。
实操环节让我改观,爬虫年报、正则提取信息、文本清洗等预处理步骤琐碎却必不可少,区分年报章节标题也让我明白量化分析需结合财会业务。结合混淆矩阵、F1指标与标注策略,我认识到优质模型离不开高质量数据。课程内容量大,BERT自注意力机制还需消化,后续我会完整复现流程实操巩固。
——河南大学 李嘉惠
通过本次Python+AI赋能数字化转型文本分析课程学习,我掌握了上市公司年报爬虫实操方法,理解了网页请求原理、文本截取规则,能够定向抓取年报MDA管理层分析文本;同时认识到传统词典分析法仅能统计字面词频、无法识别语境语义的局限性,也夯实了文本数据预处理的基础能力,明白了规范获取文本数据是量化研究的前提。课程重点讲解的BERT模型与MLM预训练思路让我收获很大,我理清了CLS、SEP特殊符号的功能,理解双向编码器理解上下文语义的核心优势,也熟悉了数据集划分、模型微调、效果评估的完整流程。这次学习打通了编程工具与经管实证研究的结合路径,后续我会多加实操练习,尝试自主搭建文本分类模型,将AI文本分析技术运用到数字化转型相关课题研究之中,研究到方法,而非方法到研究,定义变量再选择模型。
——西南大学 高欣怡

03
学霸笔记
✦






04
学习照片
✦






付阳阳 | 新疆财经大学 | ||
钟馨莹 | |||
陈建益 | |||
王萃芳 | 渤海大学 | ||
冯睿吉 | 北京交通大学 | ||
冯睿吉 | 北京交通大学 | ||
席志城 | 石河子大学 | ||
王建洋 |
杨征 | ||
石河子大学 | 博士生 | |
马骏 | 山东管理学院 | 本科生 |
付阳阳 | 新疆财经大学 | 研究生 |
王姣娅 | 汉江师范学院 | 本科生 |
张锦 | 临沂大学 | 毕业 |
钟馨莹 | ||
齐蕙梓 | 东北财经大学 | 准博士生 |
乔颖蓉 | 南京财经大学红山学院 | 毕业 |
陈建益 | 广州大学 | 准研究生 |
马骏 | 山东管理学院 | 本科生 |
徐晓东 | 北京工商大学 | 博士生 |
王建洋 | 企业 | 会计师 |
安康学院 | 教师 | |
长春工业大学 | 教师 | |
杨征 | 石河子大学 | 教师 |
王萃芳 | 渤海大学 | |
冯睿吉 | 北京交通大学 | |
席志城 | 石河子大学 | |
何子健 | ||
王皓 | 兰州大学 | |
陈晓秋 | 福建农林大学 | |
王筱晗 | 辽宁师范大学 |




近期重要推文
精简50学分·无界交叉·一生一策丨中大管院2026本科招生全新启动
蔡春、刘峰、吴溪等二十四位博导领衔,2026年财会学子暑期科研训练营“导师组”名单及课程表
END