经济史中使用大型语言模型和生成式AI的指南
本文为经济史研究人员提供了一份关于如何应用大型语言模型(LLMs)和生成式人工智能(AI)的实用指南。文章探讨了这些技术在历史数据挖掘、文本分析、模式识别等方面的潜力,同时指出了在应用过程中需要注意的局限性、偏见问题和伦理考量,帮助研究者更好地将AI工具融入经济史研究实践。
背景速读
- 这篇指南由美国国家经济研究局(NBER)发布,目的是帮助经济史学者掌握大语言模型(如ChatGPT)和生成式AI在研究中的实际用法。
- 经济史研究常涉及大量历史文献、手写档案、旧报纸等非结构化文本,LLM可以辅助转录、翻译、摘要、分类和初步分析,大幅提升效率。
- 不过,LLM存在"幻觉"问题,可能编造史实或引文;历史文本中的语言、拼写、格式也与现代不同,需要谨慎验证输出结果。
- 该指南还涉及数据提取(从历史表格或图表中结构化信息)、OCR后处理(纠正扫描识别的错误)、以及用AI生成史料元数据等具体工作流。
- 对于不熟悉AI的经济史学者,这篇论文提供了从提示词设计到结果验证的全流程入门,同时也讨论了学术伦理和可信度问题。