经济与商务实证研究方法 - 第 8 周:基于大语言模型的文本分析

完整讲义:原理、应用场景、数据标注框架、Human-in-the-Loop与稳健性实践

作者
单位

陈志远

中国人民大学商学院

发布于

2026年6月16日

1 引言

经验研究正在经历一场从”数字为主”到”数字+文本”的范式转变。企业年报中的管理层讨论与分析(MD&A)、新闻媒体的报道语调、政府政策文件的措辞变化、社交媒体上的投资者情绪——这些非结构化文本数据蕴含着传统量化指标难以捕捉的丰富信息。然而,文本数据的高维度、语义复杂性和语境依赖性,对分析方法提出了严峻挑战。

大语言模型(Large Language Models, LLMs)的兴起为经济金融文本分析带来了前所未有的机遇。从2018年GPT-1和BERT的问世,到2024年GPT-4o和Claude 3的性能跃升,LLM已经展现出全局上下文理解、强迁移学习和人类对齐等三大核心优势。但机遇与挑战并存:LLM输出结果的可复现性、“幻觉”问题、前瞻性偏误以及对提示设计的敏感性,都对实证研究的严谨性提出了新的方法论要求。

本讲围绕三个核心问题展开。第一,LLM的基本原理是什么,它与传统文本分析方法有何本质区别。第二,LLM在经济金融研究中有哪些应用场景,从文本分类到情绪分析,从主题建模到模拟人类信念生成。第三,如何系统性地将LLM整合进研究管线,从方法选择、提示设计到验证与敏感性分析,确保标注质量满足实证研究的严谨标准。

2 第一部分:从传统文本分析到LLM时代

2.1 经济学中的文本数据

文本数据在经济学和管理学研究中的应用日益广泛。常见的数据来源包括:

  • 企业信息披露:年度报告中的MD&A部分、盈利电话会议记录、IPO招股说明书。研究者从中提取管理层语调、数字化转型程度、风险披露策略等信息。
  • 新闻媒体:《华尔街日报》、财经新闻、行业报道。用于测度市场情绪、政策预期和宏观经济关注焦点。
  • 政府文本:政策文件、央行沟通声明、政府工作报告。用于量化政策不确定性、治理特征和意识形态取向。
  • 社交媒体:推特、微博、股吧帖子。用于捕捉投资者情绪、舆论动态和消费者反馈。
  • 招聘与专利数据:职位描述反映劳动力需求结构,专利摘要揭示技术发展趋势。

这些文本数据具有三个共同特征:非结构化(不直接适用于回归分析)、高维度(词汇量可达数十万)、语义复杂(语境依赖、多义词、讽刺与隐喻)。

2.2 文本分析技术的三阶段演进

2.2.1 阶段一:基于规则的方法 (1950s–1990s)

早期文本分析依赖专家手工编写符号逻辑规则。1954年的乔治城实验尝试基于规则的机器翻译,1966年的ELIZA程序模拟心理治疗对话。这类方法主观性强、错误率高、难以扩展,但在特定狭窄领域(如正则表达式匹配)仍有应用价值。

2.2.2 阶段二:统计语言模型 (1990s–2017)

这一阶段见证了n-gram模型、概率潜在语义分析(PLSA)和潜在狄利克雷分配(LDA)的发展。2013年,Mikolov等提出的Word2Vec词嵌入技术是一个重要突破:通过将词语表示为低维稠密向量,避免了词袋模型的维数灾难,并能够捕捉词语间的语义关系。

然而,统计方法仍面临三大瓶颈:

  1. 维数灾难:词袋模型维度与词汇量成正比,处理大规模文本时效率极低。
  2. 忽略语序:Word2Vec等方法仅学习词语共现,无法区分”小狗追人”与”人追小狗”的语义差异。
  3. 上下文缺失:同一词语在不同语境下含义不同,但传统方法生成固定词向量,无法适应语境变化。

2.2.3 阶段三:大语言模型时代 (2018–至今)

2018年6月,OpenAI发布GPT-1,提出”通用文本预训练+特定任务微调”的范式。同年10月,Google发布BERT,引入双向编码器架构。2020年GPT-3将参数规模提升至1750亿,展现出涌现能力(emergent ability)。2022年11月ChatGPT问世,2023年GPT-4引入多模态功能,2024年GPT-4o进一步降低API成本并提升性能。

2.3 为什么经济学需要LLM

经济学文本尤其复杂。央行沟通中的模糊措辞(“密切关注”“适时调整”)蕴含政策信号;年报中的前瞻性陈述需要理解行业语境才能判断乐观程度;政策文件的修辞变化可能反映治理理念转型。这些任务要求模型具备全局上下文理解能力,而这正是LLM的核心优势。

Lin & Sun (2025)将LLM在经济金融文本分析中的优势总结为三点:

  1. 全局上下文理解:通过位置编码和多头自注意力机制,综合考虑全篇语义,捕捉复杂语义关系和长距离依赖性。
  2. 强迁移学习能力:在庞大语料库上预训练后,具备零样本或少样本学习能力,无需大量标注即可处理经济金融术语。
  3. 人类对齐能力:模拟人类阅读后的信念与预期生成,开创”AI行为科学”新场景——这是传统方法完全无法实现的能力。

3 第二部分:LLM基本原理

3.1 Transformer架构

当前主流LLM几乎都基于Transformer架构(Vaswani et al., 2017)。与循环神经网络(RNN)按顺序处理文本不同,Transformer通过自注意力机制直接建模序列中任意两个位置之间的关系。

自注意力的核心计算为:

Attention(Q,K,V)=softmax(QKTdk)V \text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V

其中QQ(查询)、KK(键)、VV(值)是输入序列的三种线性变换。除以dk\sqrt{d_k}是为了防止点积过大导致softmax梯度消失。

Transformer的两个关键技术创新是:

  • 位置编码(Position Embedding):将词序信息引入词向量,使模型能够区分不同位置的相同词语。即使词语完全相同,位于不同位置的词嵌入也不同。
  • 多头自注意力(Multi-head Self-attention):将注意力机制复制多份,每份(称为一个”头”)使用不同的线性变换参数,从多个角度同时关注输入序列的所有位置。最终将所有头的输出拼接并再次线性变换,生成蕴含丰富上下文信息的表示。

3.2 GPT与BERT:两种范式对比

GPT和BERT代表了LLM的两种基本架构取向:

关键特点 GPT(生成式) BERT(判别式)
架构 Transformer解码器,单向建模 Transformer编码器,双向建模
预训练任务 预测下一个词 掩码语言模型(MLM)+下一句预测
上下文处理 从左到右顺序处理 同时捕捉前后文信息
提示工程 依赖精心设计提示优化输出 通常不依赖提示工程
主要优势 生成式任务(文本生成、对话、写作辅助) 判别式任务(分类、标注、命名实体识别)
访问方式 ChatGPT网页或OpenAI API API或本地部署

在经济金融研究中,这一区分具有重要方法论含义:如果需要生成信念或预期(如让模型阅读新闻后预测通胀走势),GPT类模型更为适合;如果需要对文本进行分类或标注(如判断年报语调是积极还是消极),BERT类模型通常更稳定、可复现性更强。

3.3 从Word2Vec到上下文词嵌入

词嵌入技术的演进反映了文本表示能力的逐步提升:

  • Word2Vec(2013):固定词向量,忽略语境。“bank”在”river bank”和”bank account”中向量完全相同。
  • ELMo(2018):上下文相关,但仅基于单层双向LSTM,表示能力有限。
  • BERT/GPT:深层Transformer,多层迭代增强,真正实现了语境化的词表示。同一词语在不同句子中的嵌入向量不同。

Transformer与传统词嵌入技术的核心差异在于:

对比维度 Transformer架构LLM Word2Vec等传统技术
位置信息 通过位置编码引入词序 无法直接引入位置信息
上下文捕捉 全局聚合,处理长距离依赖 仅固定窗口内的局部上下文
语义依赖 直接建模任意距离词元间关系 无法处理复杂语义依赖
词嵌入信息 同时包含词序和上下文语义 仅基于词语共现,缺乏上下文

3.4 经济金融专用LLM

通用LLM虽强大,但领域专用模型在特定任务上表现更优。经济金融专用LLM的发展脉络如下:

年份 代表模型 基准架构 特点
2019 FinBERT-19 BERT 早期金融情绪分析专用模型
2022 ESGBERT BERT ESG文本分类专用
2023 BloombergGPT BLOOM 500亿参数,彭博社金融数据训练
2023 FinGPT LLaMA-2 开源金融大模型,多版本迭代
2024 FinSentGPT GPT-3.5 跨语言金融情绪分析
2024 姜富伟等中文金融大模型 BERT 融合结构化市场数据与非结构化文本

中文金融LLM具有特殊价值。中国特有的政策语境、行业术语和修辞风格(如”稳中求进”“底线思维”)要求专用模型。直接使用英文训练模型分析中文政策文本,效果可能大打折扣。

3.5 提示工程基础

使用GPT类模型时,提示(prompt)的质量直接决定输出效果。赵鑫等(2024)总结了提示设计的四项基本原则:

  1. 清晰表达任务目标:避免模糊指令,明确说明期望输出格式。
  2. 分解为简单子任务:复杂任务分步进行,降低模型理解难度。
  3. 提供少样本示例:用3-5个示例引导模型理解期望输出格式和判断标准。
  4. 采用模型友好格式:结构化输入,明确标签与分隔符,减少解析歧义。

常用的高级提示策略包括:

  • Chain-of-Thought(思维链):要求模型”一步步思考”,在给出最终答案前先展示推理过程,显著提升复杂推理任务的准确性。
  • Few-shot Learning:在提示中嵌入标注示例,使模型从示例中学习任务模式和输出格式。
  • Role Prompting:让模型扮演特定角色(如”你是一位宏观经济学家”),激活相关领域知识。

4 第三部分:六大应用场景

Lin & Sun (2025)将LLM在经济金融文本分析中的应用归纳为六大传统场景和一个全新场景。传统场景是LLM作为更优工具替代或增强传统方法;全新场景则展示了LLM独有的能力。

4.1 场景一:计算文本相似度

核心思想是将文本转化为向量,计算余弦相似度。与传统词袋模型相比,LLM生成的向量包含语义信息而非仅用词重叠,能识别”用不同词语表达同一概念”的文本对。

代表性研究包括:Vamvourellis et al. (2023)使用SBERT和GPT生成公司描述词嵌入,识别相似公司,发现相似公司股票收益相关性显著高于行业平均水平。Breitung & Müller (2023)利用LLM词嵌入衡量全球商业网络,在识别客户、供应商关系方面优于传统行业分类。胡增玺和马述忠(2023)使用Sentence-BERT计算专利摘要与数字经济产业描述的相似度,实现数字创新识别。

4.2 场景二:提取文本向量进行预测

将文本嵌入作为特征变量输入预测模型,是LLM在量化金融中的重要应用方向。

Barbaglia et al. (2021)比较了BERT、Word2Vec和GloVe提取的新闻词嵌入在预测S&P 500波动率方面的表现,发现BERT显著优于传统方法。Chen et al. (2023)综合分析16个国家13种语言的新闻,使用LLM词嵌入预测股票市场收益。Yang (2023)使用ada-002模型提取专利文本向量,预测专利价值和申请接受率。

LLM向量的优势在于蕴含整体语义信息和叙事注意力,预测力来源比传统词袋模型更深层。

4.3 场景三:文本数据识别与分类

文本分类是管理研究中最常见的LLM应用场景,也是本讲后续重点讨论的方法论主题。

Hansen et al. (2023)使用改进的DistilBERT模型识别2.5亿条招聘信息中的远程工作职位,准确率达99%,远超词典法。刘青和肖柏高(2023)利用BERT模型判断专利是否属于劳动节约型技术,样本外准确率90%。金星晔等(2024)使用ERNIE大模型对上市公司年报句子分类,构建企业数字化转型新指标。

需要特别区分”分类”与”标注”:分类是技术层面的标签分配;标注则是为下游因果推断服务的结构化编码。Carlson & Burbano (2026)强调,在社会科学中,即使分类准确率高达99%,若分类误差与结果变量系统相关,也可能导致下游推断偏误。

4.4 场景四:构建特定领域词典

传统词典法(如Loughran & McDonald, 2011的LM词典)需要手工编制和定期更新,难以适应新兴术语。LLM可以自动识别和扩展领域相关术语。

Chava et al. (2021a)使用RoBERTa构建环境与社会(E&S)领域词典,发现环境话题讨论与污染减排、绿色专利正相关。Gupta et al. (2022023)使用BERT从SEC文件中自动创建情绪词典,效果优于传统LM词典。在中国情境下,研究者可以尝试利用LLM基于政府工作报告构建”新质生产力”“企业数字化转型”等具有中国特色的问题导向词典。

4.5 场景五:主题建模与分析

传统LDA主题模型存在四大局限:主题数量选择主观、忽略单词上下文语义、短文本效果差、计算效率低。

BERTopic(Grootendorst, 2022)是基于LLM的创新主题模型,通过三步识别主题:首先用BERT将文本转为词嵌入;然后降维聚类,将语义相似文本归入同一主题;最后用类内TF-IDF提取关键词。其优势包括自动确定主题数量、捕捉整体语义、适用于短文本、可GPU加速。

Born et al. (2023)利用BERTopic从Twitter提取通胀相关主题构建高频通胀指数。Tang et al. (2024)发现新闻标题主题信息可作为公司债券违约的预警信号。近期研究还提出了基于GPT的TopicGPT和GPTopic方法,所识别主题与人类注释的真实主题更加接近。

4.6 场景六:文本情绪分析

文本情绪分析是LLM在经济金融领域最常见的应用,主要方向包括:

新闻媒体情绪预测股票收益:Lopez-Lira & Tang (2023)发现ChatGPT分析的新闻情绪具有强于传统方法的收益预测能力,但需注意前瞻性偏误问题——LLM训练数据可能包含待分析文本,导致”记住”而非”理解”。

管理层语调与市场反应:Beckmann et al. (2024)使用GPT-4-Turbo从25个维度识别异常财务沟通,发现其引发显著负面市场反应,尤其当高管信息模糊、分析师提问缺乏深度时。

央行政策沟通量化:Hansen & Kazinnik (2023)证明GPT理解美联储式讲话(Fedspeak)的能力超越传统测度方法。Peskoff et al. (2023)使用GPT-4量化FOMC在通胀问题上的内部分歧,发现会议纪要比公开声明更能反映鹰派与鸽派的分歧。

4.7 全新场景:LLM作为经济代理人

这是LLM独有的能力,所有传统方法无法实现。核心思想是利用LLM的人类对齐能力,模拟人类阅读文本后的信念形成与决策过程。

Bybee (2023)让GPT-3.5阅读《华尔街日报》历史新闻,生成对宏观变量的预期指标,发现与大规模调查指标高度相关。Jha et al. (2024)让GPT分析盈利电话会议,生成ChatGPT投资得分,与CFO调查指标显著相关。Li et al. (2024)提出EconAgent概念,LLM在模拟环境中做出接近人类的工作和消费决策。

Meng (2024)将这一趋势称为”AI行为科学”(homo silicus)的兴起——研究者可以赋予LLM特定禀赋和信息,观察其反应,从而低成本地探索政策效果或市场动态。

5 第四部分:数据标注框架

5.1 为什么需要系统框架

LLM标注看似简单——“写一个提示,批量调用API”——但细微的实现选择会显著影响结果。Battle & Gollapudi (2024)和Sclar et al. (2023)的实证研究表明,提示措辞的微小变化可能导致分类分布和下游回归系数的显著差异。

更重要的是,社会科学研究使用LLM标注通常作为中间步骤,目的是检验下游假设。这与计算机科学追求分类准确率最大化的目标不同。Carlson & Burbano (2026)的核心发现是:高第一阶段分类准确率不保证无偏下游推断。当分类误差与结果变量系统相关时,即使99%准确率的标注也可能导致错误结论。

5.2 Carlson & Burbano (2026) 五阶段框架

5.2.1 Stage 1:方法选择

研究者应将LLM视为方法工具箱的一部分,根据研究情境匹配工具:

方法 优势 局限 适用场景
人工编码 高准确率, nuanced理解 昂贵、慢、规模受限 小样本、复杂语境
词典/关键词 透明、简单、可复现 僵化、忽略语境 狭窄技术术语
监督ML 可扩展、一致 需大量标注训练数据 有历史标注数据
LLM 灵活、无需训练数据 潜在不稳定、不透明 复杂语义、探索性研究

核心原则: newer is not always better。传统词典法在精确技术术语识别上可能优于LLM;监督ML在有充足历史标注时可能更稳定。LLM的真正优势在于快速原型验证和敏感性测试。

5.2.2 Stage 2:模型选择与稳定性

模型迭代极快,研究者面临前沿性能与长期可复现性的权衡。最佳实践包括:

  • 记录具体模型版本号(如GPT-4-turbo-2024-04-09),而非笼统的”GPT-4”
  • 若使用开源模型,存档模型权重文件
  • 为复现需求预留计划(API模型可能随时迭代或下线)
  • 处理敏感数据时,确认服务商的使用与存储政策
  • 考虑国产替代方案(Kimi、文心一言、通义千问)以降低成本和提升数据安全

5.2.3 Stage 3:提示工程

提示设计不是”细节”,而是影响推断的研究设计选择。Carlson & Burbano (2026)在Kickstarter可持续性分类实验中发现,同一模型不同提示设计导致标签分布显著差异,下游回归系数方向和显著性随之变化。

结构化提示应包含:明确的任务定义和标签边界、指定的输出格式(如JSON便于解析)、Chain-of-Thought推理引导、覆盖标签空间和边界案例的Few-shot示例。所有提示文本应在论文附录中一字不差地公开,以满足可复现性要求。

5.2.4 Stage 4:成本与规模优化

OpenAI API按token数量计费(英文约100 token ≈ 75词)。处理大规模文本时费用可能迅速累积。建议先用小样本测试提示效果,估算全量成本后再启动批量调用。temperature参数的设置也影响成本:temperature=0提高一致性,适合标注任务;temperature>0增加多样性,适合生成任务。

5.2.5 Stage 5:验证与稳健性

核心原则是”信任但验证”。最低验证要求包括:

  1. 与人类基准对比:在代表性子集上比较LLM与人类专家标注,报告一致率
  2. 多模型交叉验证:同一任务用GPT-4、Claude、国产模型分别标注
  3. 多提示敏感性分析:系统变化提示措辞,观察下游结论是否改变
  4. 误差模式诊断:分析LLM在哪些类型文本上出错,误差是否与结果变量相关

敏感性分析不是”锦上添花”,而是使用LLM标注的必要步骤。论文应报告主结果(默认设置)和稳健性表(不同模型/提示/参数下的核心系数变化)。

6 第五部分:Human-in-the-Loop与混合标注

6.1 纯LLM标注的局限

Artemova et al. (2024)总结了四类LLM难以胜任的标注任务:

  1. 主观评价任务:需要文化背景或个人价值观的判断(如艺术质量、道德程度)
  2. 深度领域知识:医学、法律、工程等专业领域的精细区分
  3. 新兴概念识别:训练数据截止后出现的术语和现象
  4. 边界案例:模棱两可、需要复杂语境推断的案例

此外,LLM还存在社会偏见(Gallegos et al., 2024)、幻觉(Xu et al., 2024)和模型崩溃(Shumailov et al., 2024)等系统性风险。

6.2 主动学习 (Active Learning)

主动学习的核心思想是:不随机选择样本让人类标注,而是让模型”主动选择”最有信息量的样本——即模型最不确定的案例。常用策略包括:

  • Least Confidence:选择模型置信度最低的样本,适用于二分类任务
  • Breaking Ties:选择前两名概率最接近的样本,适用于多分类任务
  • BADGE:基于梯度多样性选择,适用于深度模型批量标注
  • Contrastive AL:利用对比学习选择信息量大的样本

主动学习的价值在于用最少的人类标注预算最大化模型性能提升,是连接LLM自动标注与人类专家知识的桥梁。

6.3 混合标注流程

Artemova et al. (2024)提出的混合标注(Hybrid Pipeline)包含四个步骤:

  1. 模型置信度估计:对每个样本,LLM输出预测概率或不确定性分数
  2. 阈值路由:设定置信度阈值。高置信度样本由LLM自动标注;低置信度样本路由至人工标注(专家或众包)
  3. 响应聚合:整合LLM和人类的标注结果,通过加权或投票机制生成最终标签
  4. 持续迭代:用新增标注数据微调LLM,提升下一轮自动标注质量

工业案例(产品推荐与广告搜索)表明,简单查询可由LLM直接处理,模糊查询需人工判断。通过动态调整阈值,可以在质量、成本、速度之间取得最优平衡。

6.4 质量控制体系

三层质量控制体系确保标注数据的可靠性:

第一层:标注者管理 - 准入考试测试标注者是否理解指南 - 持续培训与反馈,纠正常见错误 - 关注标注者心理健康,避免重复性劳动导致的疲劳

第二层:过程监控 - 控制任务(Gold Questions):插入已知答案的测试题,检测标注者是否在认真工作 - 动态重叠:对困难样本增加标注者数量,提高可靠性 - 时间监控:异常短的标注时间可能暗示敷衍或作弊

第三层:结果验证 - 标注者间一致性:Krippendorff’s Alpha (α) ≥ 0.6为可接受标准,α ≥ 0.8为高度一致 - 专家审计:领域专家抽查标注质量 - LLM辅助质检:用独立LLM检查标注一致性

需要特别注意的是,高一致性不等于高准确性。如果所有标注者都系统性地误解了指南,一致率可能很高但标注完全错误。因此,一致性检查需配合专家基准或控制任务共同使用。

7 第六部分:局限性与稳健性实践

7.1 四大核心局限

可复现性与”黑箱”:即使temperature=0、相同提示,LLM输出也可能存在差异。模型结构复杂,难以解释为何做出特定判断。Ash & Hansen (2023)指出,不可复现的结果对经济学研究的可信性构成严重威胁。

幻觉(Hallucination):LLM可能生成看似合理但虚假的信息。Lin & Sun (2025)展示了GPT-4o在要求列举2024年AER论文时,生成了完全不存在的第一篇标题,以及发表时间错误的第二篇标题。在金融分析和政策评估中,幻觉可能导致严重后果。

前瞻性偏误:LLM训练数据包含”未来信息”,分析”过去文本”时可能泄露未来知识。主流解决方法是分别报告训练截止点前(样本内)与后(样本外)的结果。新兴方案如TimeMachineGPT——每个时间点使用独立预训练的模型,确保不包含未来信息。

长文本与隐私:上下文窗口限制使年报、长文章等难以整体输入。拆分或截断处理可能扭曲信息。金融数据涉及敏感信息,上传至第三方API存在隐私泄露风险。

7.2 敏感性分析策略

Carlson & Burbano (2026)推荐的三维敏感性分析框架:

  1. 模型维度:至少测试2-3个不同模型(如GPT-4、Claude、Kimi)
  2. 提示维度:系统变化提示的措辞、结构、示例数量
  3. 参数维度:调整temperature、max_tokens等超参数

论文报告规范应包括:主结果(默认设置的基准分析)、稳健性表(不同设置下的核心系数变化)、边界分析(若结果方向或显著性随设置改变,需诚实报告不确定性范围)。

7.3 论文写作建议

使用LLM标注的实证论文应包含以下方法论文档:

  • 附录A:完整提示文本(一字不差)
  • 附录B:模型版本、访问日期和API参数
  • 附录C:与人类标注的对比分析(一致率、混淆矩阵、误差模式)
  • 附录D:敏感性分析结果(多模型、多提示、多参数)
  • 正文:明确声明”本研究使用LLM生成中间变量,结果对提示设计和模型选择敏感”

8 第七部分:课堂实验

8.1 实验目标

本实验演示使用Python调用OpenAI API进行文本分类,对比零样本(Zero-shot)与少样本(Few-shot)的效果差异,并展示不同temperature参数对输出稳定性的影响。

注意:本实验为教学演示,使用虚构示例文本。实际研究中,API调用需考虑费用、数据隐私和可复现性。小规模探索性分析可在本地开源模型(如ChatGLM、Qwen)上完成。

8.2 API调用基础

import openai

# 设置API密钥(实际研究中应使用环境变量)
# openai.api_key = "your-api-key"

def classify_text(text, prompt_template, model="gpt-4o", temperature=0):
    """
    使用OpenAI API对文本进行分类
    """
    response = openai.chat.completions.create(
        model=model,
        messages=[
            {"role": "system", "content": "你是一位专业的文本分析助手。"},
            {"role": "user", "content": prompt_template.format(text=text)}
        ],
        temperature=temperature,
        max_tokens=150
    )
    return response.choices[0].message.content

8.3 零样本 vs 少样本提示

# 零样本提示
zero_shot_prompt = """
请将以下企业年报段落按情绪分类为:积极、消极、中性。

文本:{text}

情绪:
"""

# 少样本提示(嵌入3个示例)
few_shot_prompt = """
请将以下企业年报段落按情绪分类为:积极、消极、中性。

示例1:
文本:"公司本年度营收同比增长15%,净利润创历史新高。"
情绪:积极

示例2:
文本:"受宏观经济下行影响,主要产品销量出现下滑。"
情绪:消极

示例3:
文本:"公司将继续推进数字化转型战略。"
情绪:中性

待分类文本:{text}

情绪:
"""

8.4 批量处理与成本估算

import pandas as pd
import time

# 示例数据集
texts = [
    "公司上半年业绩超预期,市场份额稳步提升。",
    "原材料价格上涨对毛利率造成一定压力。",
    "董事会审议通过了下一阶段的战略规划。"
]

results = []
for text in texts:
    label = classify_text(text, few_shot_prompt, temperature=0)
    results.append({"text": text, "label": label})
    time.sleep(0.5)  # 避免触发API速率限制

df_results = pd.DataFrame(results)
print(df_results)

成本估算:GPT-4o约$5/百万输入token + $15/百万输出token。一次典型分类调用(500词输入+50词输出)约$0.003;1万条文本批量标注约$30。国产替代(如Kimi API)成本通常低50-70%。

9 总结

本讲围绕大语言模型在经济学和管理学文本分析中的应用展开,核心要点可概括为三句话:

  1. LLM不是文本分析的”万能药”,而是方法工具箱中的新工具——选择方法需匹配研究情境,传统词典法或监督ML在特定场景下可能更合适。

  2. 验证和敏感性分析是方法严谨性的必要组成部分,不是可选项——高第一阶段分类准确率不保证无偏下游推断,多模型、多提示、多参数的敏感性分析必须报告。

  3. Human-in-the-Loop和混合标注流程是平衡成本、质量与规模的最佳实践——尤其在主观性强或领域知识密集的任务中,纯LLM标注存在幻觉、偏见和领域盲区等系统性风险。

10 参考文献

Artemova, E., Tsvigun, A., Schlechtweg, D., Fedorova, N., Tilga, S., & Obmoroshev, B. (2024). Hands-On Tutorial: Labeling with LLM and Human-in-the-Loop. arXiv:2411.04637.

Carlson, N. A., & Burbano, V. (2026). The use of LLMs to annotate data in management research: Foundational guidelines and warnings. Strategic Management Journal, 47, 699–725.

Lin, J., & Sun, L. (2025). 大语言模型与经济金融文本分析:基本原理、应用场景与研究展望. 计量经济学报, 5(1), 1–28.

Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is all you need. Advances in Neural Information Processing Systems, 30.