第一天:文本数据采集与LLM增强分析(6小时) 课时一:文本分析在经管研究中的崛起(1.5小时) 1. 为什么文本数据是实证研究的新“石油” · 传统财务数据已“开采殆尽”,文本数据蕴含丰富的“软信息” · 文本分析在经管研究中的典型应用矩阵:企业竞争力、制造业服务化、管理层情绪、企业战略、风险信息披露 2. 文本分析的技术演进:从词袋到LLM · 第一代:词典法(LIWC、Hownet)——预设词典统计词频 · 第二代:机器学习法(SVM、随机森林)——人工标注+训练分类器 · 第三代:词嵌入(Word2Vec、BERT)——理解语义相似性 · 第四代:LLM增强(GPT、Claude)——理解语境、推理隐含信息、零样本分类 3. AI Agent在文本分析中的角色定位 · 传统模式:研究者设计词典 → 人工/半自动编码 → 手动整理 · Agent模式:研究者设计Prompt → Agent自动提取 → 结构化输出 · 从“统计词频”到“理解语义”,从“人工设计词典”到“模型自动推理” 课时二:LLM文本分析的Prompt工程与质量控制(1.5小时) 1. RTCE框架在文本分析中的应用 · R(角色):领域专家身份设定 · T(任务):明确的提取目标和输出格式 · C(约束):证据要求、置信度、质量门槛 · E(示例):顶刊论文的编码标准参考 2. 文本预处理——让LLM“读懂”你的文本 · 文本清洗:去除噪音、统一编码 · 段落分割与章节识别(MD&A子结构定位) · 长度控制与分块策略(处理超长文本) 3. 质量控制与稳健性考量 · Prompt敏感性测试:同一文本多个Prompt版本对比 · 模型交叉验证:GPT-4 vs Claude vs Qwen结果一致性 · 人工抽样验证:边界案例的准确率评估 · 置信度评分机制:让Agent“知道自己的不确定” 课时三:实操1——Agent自动提取核心竞争力(1.5小时) 1. 案例论文精读 · 戚聿东、孙昌玲、王化成(2021):企业核心竞争力能够降低权益资本成本吗——基于文本分析的经验证据 · 核心方法:从年报“核心竞争力分析”章节通过文本分析法构建度量指标 2. Agent任务设计 · 自动定位“核心竞争力分析”章节 · 提取核心竞争力完整描述 · 提取3-5个核心关键词 · 识别优势类型:技术/品牌/人才/成本/规模/渠道 3. RTCE提示词设计与执行 · 完整Prompt设计与迭代优化 · Agent自动运行与结果输出 · 多公司批量处理与数据集构建 课时四:实操2——Agent从MD&A构建服务化变量(1.5小时) 1. 案例论文精读 · Ni, Wu, Jiang, Jiang(2024):The Bullwhip Effect in Servitized Manufacturers · 核心创新:用GPT识别10-K报告中企业服务化信息,提供可操作的LLM变量构造方案 2. 制造业服务化的识别标准 · 信号一:产品+服务组合(解决方案、系统集成、全生命周期服务) · 信号二:服务收入占比 · 信号三:客户关系深化(增值服务、定制化) · 信号四:组织架构调整(服务部门、服务事业部) · 信号五:战略陈述(服务化转型、从制造到服务) 3. 服务化得分构建 · 0-10分制评分标准设计 · 关键证据提取与置信度标注 · 批量处理与数据集输出 |
第二天:PDF解析、多模态数据与顶刊复现(6小时) 课时五:PDF数据解析——从年报中提取结构化信息(1.5小时) 1. PDF解析的技术挑战与技术方案 · 挑战:PDF是“显示格式”非“数据格式”、表格结构复杂、多模态内容混合、扫描版需OCR · 方案一:OCR + 版面分析 + LLM理解(pdfplumber、Camelot、PyMuPDF) · 方案二:多模态大模型直接理解(GPT-4V、Qwen-VL) 2. 年报PDF的典型提取任务 · “核心竞争力分析”章节提取 · “主营业务分析”表格提取(主要产品名称) · “管理层讨论与分析”(MD&A)全文提取 3. PDF解析工具对比与选型 · pdfplumber:精确提取文本和表格 · Camelot:专门提取复杂表格 · PyMuPDF:大规模文本提取 · MinerU:PDF转Markdown 课时六:实操3——Agent从年报PDF提取产品与核心竞争力(1.5小时) 1. Agent任务设计 · 从PDF自动定位“核心竞争力分析”和“主营业务分析”章节 · 提取核心竞争力完整描述、关键词、优势类型 · 提取主要产品名称列表(处理表格和文本两种格式) 2. 多模态PDF解析实战 · 文本型PDF:pdfplumber直接提取 · 扫描型PDF:OCR预处理 · 表格提取:Camelot处理合并单元格和跨页表格 3. 结构化输出与数据质量控制 · JSON/CSV格式输出 · 来源页码标注(可追溯性) · 置信度评分与异常标记 课时七:实操4——Agent图片数据提取与CEO表情识别(1.5小时) 1. 案例论文精读 · Momtaz(2021):CEO Emotions and Firm Valuation in Initial Coin Offerings · 核心方法:人工智能情感智能(Artificial Emotional Intelligence)识别CEO面部表情 2. 多模态大模型的面部表情识别能力 · Ekman六种基本情绪:喜悦、惊讶、愤怒、悲伤、恐惧、厌恶 · 情绪强度量化(0-10分) · 置信度评估与低质量图片处理 3. Agent任务设计 · CEO图片加载与质量检查 · 多模态大模型情绪识别 · 情绪类型 + 强度 + 关键面部特征描述 · 批量处理与数据集构建 课时八:顶刊复现——多模态数据变量构建全流程(1.5小时) 1. 三种非结构化数据 → 三种变量构建方法的对比与整合 案例一:PDF文本提取(戚聿东等,2021,《会计研究》) · 数据来源:年报PDF“核心竞争力分析”章节 · 核心技术:PDF解析 + LLM语义理解 · 输出变量:核心竞争力描述、关键词、优势类型 案例二:MD&A文本分析(Ni等,2024,Management Science) · 数据来源:10-K报告MD&A章节 · 核心技术:LLM文本理解 + 零样本分类 · 输出变量:制造业服务化得分(0-10分) 案例三:CEO图片分析(Momtaz,2021,SMJ) · 数据来源:CEO公开图片 · 核心技术:多模态大模型情绪识别 · 输出变量:情绪类型、情绪强度 2. 从非结构化数据到实证变量的完整价值链 · 原始数据(PDF/文本/图片)→ 信息提取(AI Agent)→ 变量构建(研究者设计)→ 实证分析(DID/DDML等) 3. Agent Skill封装与复用 · 将每个提取流程封装为可复用的Agent Skill · 批量处理与数据集自动化构建 3.课程总结与答疑(30分钟) · 两天课程核心要点回顾 · Q&A自由提问 · 配套Skill宝典发布(10+文本与多模态分析Skill) · 后续学习路径建议 |
授课时间:暂定10月中下旬,两个周末各一天
课程价格:
单课价格:优惠价799元(原价999元)
组合价格:1999元,即购买《掌握半小时复现一篇论文:用Claude Code 复现顶刊、自动化科研论文训练营》赠送本课程!!!

报名:倘若您对课程感兴趣,扫描下方右侧二维码可直接购买,扫描下方左侧二维码可添加陈老师微信询问课程详情及发票事宜(可开培训费、技术服务费、资料费、数据采集费等)。

课程咨询二维码 课程购买二维码