经济与商务实证研究方法

第 8 周:基于大语言模型的文本分析——原理、应用与验证

陈志远

中国人民大学商学院

2026-06-25

上节课回顾

从结构估计到文本数据

  • W5-W6 的核心是结构模型:从观测行为反推深层原语(偏好、技术、约束)
  • 结构估计需要高质量的数据输入,而现实中大量信息以非结构化文本形式存在
  • 企业年报、新闻、政策文件、社交媒体——传统方法难以充分挖掘其信息含量

本节课的问题

大语言模型能否帮助研究者更高效、更准确地从海量文本中提取结构化信息,同时保持实证研究的严谨性?

本讲路线图

七个模块

  1. 从传统文本分析到LLM:文本分析技术的演进与经济学需求
  2. LLM基本原理:Transformer、GPT与BERT、词嵌入机制
  3. 六大应用场景:相似度、预测、分类、词典、主题、情绪
  4. 数据标注框架:Carlson & Burbano (2026) 五阶段实施指南
  5. Human-in-the-Loop:混合标注、主动学习与质量控制
  6. 局限性与稳健性:幻觉、可复现性、敏感性分析
  7. 课堂实验:调用API进行文本分类与提示工程对比

一、从传统文本分析到LLM

经济学中的文本数据

经验研究正经历从“数字为主”到“数字+文本”的范式转变:

数据类型 典型来源 研究用途
企业信息披露 年报、MD&A、盈利电话会议 管理层语调、数字化转型
新闻媒体 《华尔街日报》、财经新闻 市场情绪、政策预期
政府文本 政策文件、央行沟通、政府工作报告 政策不确定性、治理特征
社交媒体 推特、微博、股吧 投资者情绪、舆论动态
招聘与专利 职位描述、专利摘要 技术趋势、劳动需求

文本数据的特征

  • 非结构化:不直接适用于回归分析
  • 高维:词汇量可达数十万,远超样本量
  • 语义复杂:语境依赖、多义词、讽刺与隐喻

文本分析技术的三阶段演进

阶段一:基于规则的方法 (1950s–1990s)

  • 专家手工编写符号逻辑规则
  • 代表:早期机器翻译、ELIZA对话系统
  • 局限:主观性强、错误率高、难以扩展

阶段二:统计语言模型 (1990s–2017)

  • n-gram模型、PLSA、LDA主题模型
  • Word2Vec词嵌入技术(2013)
  • 突破:避免主观性,学习词语共现关系
  • 局限:维数灾难、忽略语序、缺乏上下文理解

阶段三:大语言模型时代 (2018–至今)

  • GPT-1 (2018) → GPT-4 (2023) → GPT-4o (2024)
  • BERT及专用变体(FinBERT、BloombergGPT等)
  • 核心优势:上下文理解、迁移学习、人类对齐

为什么传统方法难以满足经济学需求?

传统方法的三大瓶颈

  1. 维数灾难:词袋模型维度与词汇量成正比,大规模文本时效率极低
  2. 忽略语序:Word2Vec等方法仅学习词语共现,无法区分“小狗追人”与“人追小狗”
  3. 上下文缺失:同一词语在不同语境下含义不同,传统方法生成固定词向量

经济学文本尤其复杂:

  • 央行沟通的模糊措辞(“密切关注”“适时调整”)蕴含政策信号
  • 年报中的前瞻性陈述需要理解行业语境才能判断乐观程度
  • 政策文件的修辞变化可能反映治理理念转型

LLM带来的新可能性

三大核心优势(Lin & Sun, 2025)

  1. 全局上下文理解:通过位置编码和多头自注意力,综合考虑全篇语义
  2. 强迁移学习能力:零样本/少样本学习,无需大量标注即可处理经济金融术语
  3. 人类对齐能力:模拟人类阅读后的信念与预期,开创“AI行为科学”新场景

这些优势意味着LLM可以做到传统方法做不到的事——比如让模型读完新闻后生成对通胀的预期,再跟人类调查数据对比。

二、LLM基本原理

Transformer架构的核心

当前主流LLM几乎都基于Transformer架构(Vaswani et al., 2017):

\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V

两个关键技术

  • 位置编码(Position Embedding):将词序信息引入词向量,使模型能区分不同位置的相同词语
  • 多头自注意力(Multi-head Self-attention):从多个角度同时关注输入序列的所有位置,实现全局语义整合

类比:多头自注意力就像一个大型学术会议的多个分论坛——每个“头”专注不同话题,综合各论坛见解形成全面理解。

GPT vs BERT:两种范式

关键特点 GPT(生成式) BERT(判别式)
架构 Transformer解码器,单向建模 Transformer编码器,双向建模
预训练任务 预测下一个词 掩码语言模型(MLM)+ 下一句预测
上下文处理 从左到右顺序处理 同时捕捉前后文信息
提示工程 依赖精心设计提示优化输出 通常不依赖提示工程
主要优势 生成式任务(文本生成、对话、写作辅助) 判别式任务(分类、标注、命名实体识别)
访问方式 ChatGPT网页或OpenAI API API或本地部署

提示

经济学研究的启示

  • 需要生成信念/预期 → GPT类模型
  • 需要文本分类/标注 → BERT类模型通常更稳定、可复现性更强

从Word2Vec到上下文词嵌入

词嵌入技术的演进

  • Word2Vec(2013):固定词向量,忽略语境。“bank”在“river bank”和“bank account”中相同
  • ELMo(2018):上下文相关,但仅单层双向LSTM
  • BERT/GPT:深层Transformer,多层迭代增强,真正语境化的词表示

Transformer vs 传统词嵌入的核心差异:

对比维度 Transformer架构LLM Word2Vec等传统技术
位置信息 通过位置编码引入词序 无法直接引入位置信息
上下文捕捉 全局聚合,处理长距离依赖 仅固定窗口内的局部上下文
语义依赖 直接建模任意距离词元间关系 无法处理复杂语义依赖
词嵌入信息 同时包含词序和上下文语义 仅基于词语共现,缺乏上下文

经济金融专用LLM

但通用模型不是万能的。领域专用模型在特定任务上往往更好(Li et al., 2023):

年份 代表模型 基准架构 特点
2019 FinBERT-19 BERT 早期金融情绪分析专用模型
2022 ESGBERT BERT ESG文本分类专用
2023 BloombergGPT BLOOM 500亿参数,彭博社金融数据训练
2023 FinGPT LLaMA-2 开源金融大模型,多版本迭代
2024 FinSentGPT GPT-3.5 跨语言金融情绪分析
2024 姜富伟等中文金融大模型 BERT 融合结构化市场数据与非结构化文本

中文金融LLM为什么重要

中国政策文件有自己的话语体系——“稳中求进”“底线思维”“新质生产力”——这些词在英文训练语料里几乎没有出现过。拿英文模型分析中文政策文本,效果会差很多。

提示工程基础

使用GPT类模型时,提示(Prompt)的质量直接决定输出效果:

写提示的四条经验(赵鑫等, 2024)

  1. 说清楚你要什么:别写模糊的指令
  2. 把大任务拆成小步骤:一次性让模型做太多事,效果通常不好
  3. 给几个例子:放2-3个示例,模型就能理解你想要的输出格式
  4. 用结构化的格式:明确标签、分隔符,模型更容易解析

常用的高级提示策略:

  • Chain-of-Thought(思维链):要求模型“一步步思考”,提升推理准确性
  • Few-shot Learning:在提示中嵌入3-5个标注示例
  • Role Prompting:让模型扮演特定角色(如“你是一位宏观经济学家”)

三、六大应用场景

应用场景总览

Lin & Sun (2025) 将LLM在经济金融文本分析中的应用归纳为六大传统场景和一个全新场景

传统场景(LLM作为更优工具)

  1. 计算文本相似度
  2. 提取文本向量进行预测
  3. 文本数据识别与分类
  4. 构建特定领域词典
  5. 主题建模与分析
  6. 文本情绪分析

全新场景(LLM独有的能力)

  1. 作为经济代理人模拟人类生成信念或预期

场景一:文本相似度

核心思想:将文本转化为向量,计算余弦相似度。

研究案例

  • Vamvourellis et al. (2023):用SBERT/GPT生成公司描述词嵌入,识别相似公司,发现相似公司股票收益相关性显著高于行业平均
  • Breitung & Müller (2023):用LLM词嵌入衡量全球商业网络,在识别客户、供应商关系方面优于传统行业分类
  • 胡增玺、马述忠 (2023):用Sentence-BERT计算专利摘要与数字经济产业描述的相似度,识别数字创新

LLM优势:生成的向量包含语义信息而非仅用词重叠,能识别“用不同词语表达同一概念”的文本对。

场景二:文本向量提取与预测

核心思想:将文本嵌入作为特征变量输入预测模型。

研究案例

  • Barbaglia et al. (2021):BERT提取新闻词嵌入预测S&P 500波动率,优于Word2Vec和GloVe
  • Chen et al. (2023):综合分析16国13种语言新闻,LLM词嵌入预测股票市场收益
  • Yang (2023):ada-002提取专利文本向量预测专利价值和申请接受率

与传统方法的区别

传统词袋模型或Word2Vec生成的向量忽略语序和上下文,而LLM向量蕴含整体语义信息叙事注意力,预测力来源更深层。

场景三:文本识别与分类

核心思想:为文本分配预定义标签——这是管理研究中最常见的LLM应用场景。

研究案例

  • Hansen et al. (2023):DistilBERT改进模型识别2.5亿条招聘信息中的远程工作职位,准确率99%,远超词典法
  • 刘青、肖柏高 (2023):BERT模型判断专利是否属于劳动节约型技术,样本外准确率90%
  • 金星晔等 (2024):ERNIE大模型对上市公司年报句子分类,构建企业数字化转型新指标

分类任务≠标注任务

  • 分类:技术层面的标签分配
  • 标注:为下游因果推断服务的结构化编码

Carlson & Burbano (2026) 强调:社会科学中,标注误差若与结果变量系统相关,高准确率也不能保证无偏推断。

场景四:构建特定领域词典

核心思想:利用LLM自动识别和扩展领域相关术语,替代手工编制词典。

研究案例

  • Chava et al. (2021a):RoBERTa构建E&S领域词典,发现环境话题讨论与污染减排、绿色专利正相关
  • Gupta et al. (2023):BERT从SEC文件中自动创建情绪词典,效果优于传统LM词典
  • 范小云等 (2022):基于n-gram思想开发中文金融文本情绪词典

自动词典构建的优势

  • 克服手工词典更新滞后问题
  • 捕捉传统词典遗漏的新兴术语(如“碳中和”“新质生产力”)
  • 适应特定领域语境,减少通用词典的误判

场景五:主题建模与分析

传统方法:LDA(Blei et al., 2003)有四大局限——主题数量主观、忽略上下文、短文本效果差、计算效率低。

BERTopic:基于LLM的主题模型(Grootendorst, 2022)

  1. 用BERT将文本转为词嵌入向量
  2. 降维后聚类,语义相似文本归入同一主题
  3. 用类内TF-IDF提取关键词

优势:自动确定主题数量、捕捉整体语义、适用于短文本、可GPU加速。

研究案例

  • Born et al. (2023):BERTopic从Twitter提取通胀相关主题,构建高频通胀指数
  • Tang et al. (2024):新闻标题主题信息预警公司债券违约,3个月预测性能显著提升
  • 郑晓龙等 (2023):股吧文本话题分析,发现利空谣言传播中的群体行为分化

场景六:文本情绪分析

最常见的文本分析任务,三个主要方向:

应用方向 代表研究 核心发现
新闻媒体情绪→股票收益 Lopez-Lira & Tang (2023) ChatGPT情绪预测力强于传统方法,但需注意前瞻性偏误
管理层语调→市场反应 Beckmann et al. (2024) GPT-4识别25维异常财务沟通,引发显著负面市场反应
央行政策沟通→市场预期 Hansen & Kazinnik (2023) GPT理解Fedspeak的能力超越传统测度方法

前瞻性偏误问题

若LLM训练数据包含待分析文本,模型可能“记住”而非“理解”,导致伪预测能力。主流解决方法:分别报告训练截止点前(样本内)与后(样本外)的结果。

全新场景:LLM作为经济代理人

核心思想

LLM经过人类反馈训练后,能模拟人读完一段文字后形成的判断和预期——这是传统方法做不到的(Horton, 2023; Meng, 2024)。

研究案例

  • Bybee (2023):GPT-3.5阅读《华尔街日报》历史新闻,生成对宏观变量的预期指标,与大规模调查指标高度相关
  • Jha et al. (2024):GPT分析盈利电话会议,生成ChatGPT投资得分,与CFO调查指标显著相关
  • Li et al. (2024):提出EconAgent概念,LLM在模拟环境中做出接近人类的工作和消费决策

这就是“AI行为科学”(Meng, 2024)的思路——给LLM设定特定信息和偏好,观察它怎么做决策,用低成本探索政策效果或市场动态。

四、数据标注框架

为什么需要一个系统框架?

LLM标注听起来简单——写个提示,调个API,批量跑——但实现细节会显著影响结果(Battle & Gollapudi, 2024; Sclar et al., 2023)。

社会科学研究跟CS不一样

计算机科学家关心“准确率多高”。管理学者用LLM标注是为了下一步的因果推断。这意味着:

  • 第一阶段分类准确率高\;\nRightarrow\;第二阶段回归系数无偏
  • 如果LLM犯的错恰好跟你的结果变量有关,99%的准确率照样能导出错误结论

Carlson & Burbano (2026) 五阶段框架

Stage 1: 方法选择

方法 优势 局限 适用场景
人工编码 高准确率, nuanced理解 昂贵、慢、规模受限 小样本、复杂语境
词典/关键词 透明、简单、可复现 僵化、忽略语境 狭窄技术术语
监督ML 可扩展、一致 需大量标注训练数据 有历史标注数据
LLM 灵活、无需训练数据 潜在不稳定、不透明 复杂语义、探索性研究

一句话:LLM只是工具箱里的一把工具——选工具要看活,不是看工具新不新。

Stage 2: 模型选择与稳定性

关键决策

  • 模型版本:优先可复现性而非最前沿性能。记录具体版本号(如GPT-4-turbo-2024-04-09)
  • 访问方式:API vs 本地部署。API便捷但依赖第三方,本地部署需技术投入但可控
  • 开源 vs 闭源:开源可存档权重,闭源通常性能更优
  • 推理模型:针对复杂推理优化,但对基础标注任务未必更有效

提示

文档化要求

  • 记录模型名称、版本、访问日期
  • 若可能,存档开源模型权重
  • 为复现需求预留计划(模型迭代极快)
  • 敏感数据需确认服务商的使用与存储政策

Stage 3: 提示工程

结构化提示设计

  1. 任务定义:明确说明标注目标、标签定义和边界案例
  2. 输出格式:指定结构化输出(如JSON),便于解析
  3. 推理引导:Chain-of-Thought要求模型先解释再分类
  4. 示例嵌入:Few-shot示例需覆盖标签空间和边界案例

提示敏感性的实证证据

Carlson & Burbano (2026) 在Kickstarter可持续性分类实验中发现:

  • 同一模型,不同提示设计 → 标签分布显著差异
  • 下游回归系数方向和显著性随之变化
  • 结论:提示设计不是“细节”,而是影响推断的研究设计选择

Stage 4: 成本与规模优化

资源权衡

  • 样本量 vs Token用量:全文输入信息完整但成本高;摘要输入经济但可能丢失关键信息
  • 提示复杂度 vs 处理成本:详细提示提升准确率但增加费用
  • 温度参数:temperature=0提高一致性,适合标注任务;temperature>0增加多样性,适合生成任务

OpenAI API计费逻辑:按token数量计费(英文约100 token ≈ 75词)。处理大规模文本数据时,费用可能迅速累积。建议:

  • 先用小样本测试提示效果
  • 估算全量成本后再启动批量调用
  • 考虑国产替代方案(如Kimi、文心一言、通义千问)降低成本

Stage 5: 验证与稳健性

怎么验证?四个步骤

  1. 拉人类做对比:抽一个子样本,让人类专家和LLM各自标注,报告一致率
  2. 换模型跑一遍:GPT-4标完了?用Claude或Kimi再标一次,看结论变不变
  3. 改提示词再跑一遍:把提示的措辞改一改,看下游回归系数还在不在
  4. 找LLM在哪犯错:分析LLM在哪些文本上容易出错,这些错误是否跟你的结果变量有关

关键理论发现

Carlson & Burbano (2026) 证明:

高第一阶段分类准确率不保证无偏下游推断。当分类误差与结果变量系统相关时,即使99%准确率的标注也可能导致错误结论。

所以,敏感性分析不是做完主结果后的“附加题”——它是使用LLM标注的必修课

五、Human-in-the-Loop与混合标注

纯LLM标注的局限

四类任务LLM难以胜任(Artemova et al., 2024)

  1. 主观评价任务:需要文化背景或个人价值观的判断
  2. 深度领域知识:医学、法律、工程等专业领域
  3. 新兴概念识别:训练数据截止后出现的术语和现象
  4. 边界案例:模棱两可、需要语境推断的复杂案例

LLM在实际使用中还有一些问题:

  • 社会偏见:对特定群体的刻板印象(Gallegos et al., 2024)
  • 幻觉:生成看似合理但错误的信息(Xu et al., 2024)
  • 模型崩溃:仅用合成数据训练会导致性能退化(Shumailov et al., 2024)

主动学习 (Active Learning)

核心思想

不随机选择样本让人类标注,而是让模型主动选择“最有信息量”的样本——即模型最不确定的那些案例。

常用策略

策略 原理 适用场景
Least Confidence 选择模型置信度最低的样本 二分类任务
Breaking Ties 选择前两名概率最接近的样本 多分类任务
BADGE 基于梯度多样性选择 深度模型批量标注
Contrastive AL 利用对比学习选择信息量大的样本 文本分类

价值:用最少的人类标注预算,最大化模型性能提升。

混合标注流程

Artemova et al. (2024) 提出的Hybrid Pipeline

  1. 模型置信度估计:对每个样本,LLM输出预测概率或不确定性分数
  2. 阈值路由:设定置信度阈值
    • 高置信度 → 自动标注(LLM)
    • 低置信度 → 人工标注(专家/众包)
  3. 响应聚合:整合LLM和人类的标注结果,加权或投票
  4. 持续迭代:用新增标注数据微调LLM,提升下一轮自动标注质量

工业案例:产品推荐与广告搜索

  • 简单查询(“红色连衣裙”)→ LLM直接标注相关性
  • 模糊查询(“适合海边婚礼的优雅服装”)→ 人工判断
  • 通过动态调整阈值,在质量、成本、速度之间取得最优平衡

质量控制体系

三层质量控制(Artemova et al., 2024)

第一层:标注者管理 - 准入考试:测试标注者是否理解指南 - 培训与反馈:持续沟通,纠正常见错误 - 心理关怀:标注是重复性劳动,需避免过劳

第二层:过程监控 - 控制任务(Gold Questions):插入已知答案的测试题 - 动态重叠:对困难样本增加标注者数量 - 时间监控:异常短的标注时间可能暗示敷衍

第三层:结果验证 - 自动指标:标注者间一致性(Krippendorff’s α ≥ 0.6) - 专家审计:领域专家抽查标注质量 - LLM辅助质检:用独立LLM检查标注一致性

标注者间一致性

Krippendorff’s Alpha (α)

最常用的标注一致性指标,适用于: - 任意数量的标注者 - 不同类别的测量尺度(名义、顺序、区间) - 缺失数据

解释标准: - α ≥ 0.8:高度一致,结果可信 - 0.67 ≤ α < 0.8:可接受,但需谨慎解释 - α < 0.67:一致性不足,需修订指南或重新培训

注意

高一致性≠高准确性。如果所有标注者都系统性地误解了指南,一致率可能很高但标注完全错误。因此,一致性检查需配合专家基准控制任务共同使用。

六、局限性与稳健性实践

四大核心局限

局限一:可复现性与“黑箱”

  • 即使temperature=0、相同提示,LLM输出也可能有差异
  • 模型结构复杂,难以解释为何做出特定判断
  • 经济学研究强调可信性,不可复现的结果面临质疑(Ash & Hansen, 2023)

局限二:幻觉 (Hallucination)

  • LLM可能生成看似合理但虚假的信息
  • 例如:要求列举2024年AER论文,GPT-4o生成了不存在的标题(Lin & Sun, 2025)
  • 在金融分析、政策评估场景中,幻觉可能导致严重后果

局限三:前瞻性偏误

  • LLM训练数据包含“未来信息”,分析“过去文本”时可能泄露未来知识
  • 解决方法:分别报告训练截止点前/后的样本内/样本外结果
  • 新兴方案:TimeMachineGPT——每个时间点使用独立预训练的模型

局限四:长文本与隐私

  • 上下文窗口限制使年报、长文章等难以整体输入
  • 拆分/截断处理可能扭曲信息
  • 金融数据涉及敏感信息,上传至第三方API存在隐私风险

敏感性分析策略

Carlson & Burbano (2026) 推荐的三维敏感性分析

  1. 模型维度:至少测试2-3个不同模型(如GPT-4、Claude、Kimi)
  2. 提示维度:系统变化提示的措辞、结构、示例数量
  3. 参数维度:调整temperature、max_tokens等超参数

报告规范

  • 主结果:使用默认设置的基准分析
  • 稳健性表:报告不同模型/提示/参数下的核心系数变化
  • 边界分析:若结果方向或显著性随设置改变,需诚实报告不确定性范围

验证标准与最佳实践

最低验证要求

任务类型 验证标准 参考来源
二分类 与人类基准≥80%一致率 Gilardi et al. (2023)
多分类编码 Krippendorff’s α ≥ 0.6 Artemova et al. (2024)
连续评分 与人类评分的相关系数 领域基准
命名实体提取 验证集F1分数 标准NLP评估

提示

论文写作建议

使用LLM标注的实证论文应包含: - 附录A:完整提示文本(一字不差) - 附录B:模型版本与访问日期 - 附录C:与人类标注的对比分析 - 附录D:敏感性分析结果 - 正文中明确说明:“本研究使用LLM生成中间变量,结果对提示设计和模型选择敏感”

七、课堂实验:文本分类与提示工程

实验目标

演示内容

  1. 使用Python调用OpenAI API进行零样本文本分类
  2. 对比零样本(Zero-shot)与少样本(Few-shot)的效果差异
  3. 展示不同temperature参数对输出稳定性的影响
  4. 讨论成本估算与替代方案

实验边界

  • 本实验为教学演示,使用虚构/公开示例文本
  • 实际研究中,API调用需考虑费用、数据隐私和可复现性
  • 建议:小规模探索性分析可在本地开源模型(如ChatGLM、Qwen)上完成

代码骨架:API调用基础

::: {style=“font-size: 1em;”}

import openai

# 设置API密钥(实际研究中应使用环境变量)
# openai.api_key = "your-api-key"

def classify_text(text, prompt_template, model="gpt-4o", temperature=0):
    """
    使用OpenAI API对文本进行分类
    """
    response = openai.chat.completions.create(
        model=model,
        messages=[
            {"role": "system", "content": "你是一位专业的文本分析助手。"},
            {"role": "user", "content": prompt_template.format(text=text)}
        ],
        temperature=temperature,
        max_tokens=150
    )
    return response.choices[0].message.content

:::

代码骨架:零样本 vs 少样本

::: {style=“font-size: 1em;”}

# 零样本提示
zero_shot_prompt = """
请将以下企业年报段落按情绪分类为:积极、消极、中性。

文本:{text}

情绪:
"""

# 少样本提示(嵌入3个示例)
few_shot_prompt = """
请将以下企业年报段落按情绪分类为:积极、消极、中性。

示例1:
文本:"公司本年度营收同比增长15%,净利润创历史新高。"
情绪:积极

示例2:
文本:"受宏观经济下行影响,主要产品销量出现下滑。"
情绪:消极

示例3:
文本:"公司将继续推进数字化转型战略。"
情绪:中性

待分类文本:{text}

情绪:
"""

:::

代码骨架:批量处理与结果汇总

::: {style=“font-size: 1em;”}

import pandas as pd
import time

# 示例数据集
texts = [
    "公司上半年业绩超预期,市场份额稳步提升。",
    "原材料价格上涨对毛利率造成一定压力。",
    "董事会审议通过了下一阶段的战略规划。"
]

results = []
for text in texts:
    label = classify_text(text, few_shot_prompt, temperature=0)
    results.append({"text": text, "label": label})
    time.sleep(0.5)  # 避免触发API速率限制

df_results = pd.DataFrame(results)
print(df_results)

:::

提示

成本估算

  • GPT-4o:约 $5/百万输入token + $15/百万输出token
  • 一次典型分类调用(500词输入 + 50词输出)≈ $0.003
  • 1万条文本批量标注 ≈ $30
  • 国产替代(如Kimi API)成本通常低50-70%

课堂讨论

讨论问题

  1. 如果你的研究需要标注10万条微博文本,你会选择纯LLM、纯人工、还是混合方案?为什么?
  2. 如何设计一个敏感性分析方案,让你的审稿人相信LLM标注结果是稳健的?
  3. 在什么情况下,传统词典法或监督ML可能比LLM更适合?
  4. 使用第三方API进行标注,涉及哪些研究伦理和数据安全问题?

本讲总结

三句话,讲完这一讲

  1. LLM是文本分析方法工具箱里的一把新工具——用不用它、怎么用它,取决于你的研究问题,不是因为它新就该用
  2. 如果你用LLM做数据标注,结果对提示设计和模型选择很敏感。审稿人会要求你展示敏感性分析——别等到R&R才补
  3. 把LLM和人类标注者组合起来(混合标注),是当前平衡成本、质量和规模最务实的做法

推荐阅读

  • Carlson & Burbano (2026), Strategic Management Journal — LLM标注的基础框架
  • Lin & Sun (2025), 计量经济学报 — LLM与经济金融文本分析综述
  • Artemova et al. (2024), COLING Tutorial — LLM + Human-in-the-Loop实操

下节课预告

第9周:AI赋能研究自动化与工作流程治理

  • 从“手动调用API”到“自动化研究管线”
  • AI辅助文献综述、代码生成、论文写作
  • 研究中的AI治理:审计轨迹、可复现性与学术诚信

课程网站:https://zhiyuanryanchen.github.io/empirical-methods

代码与数据:详见课程GitHub仓库