布鲁盖尔-Talking-about-Europe_--exploring-70-years-of--news-archives_43页_1mb
报告摘要
总结:TALKING ABOUT EUROPE: EXPLORING 70 YEARS OF NEWS ARCHIVES
核心内容
本文通过分析1945年至2019年间法国、德国和意大利三份主流报纸(Le Monde、Der Spiegel 和 La Stampa)的新闻档案,探讨了欧洲议题在媒体报道中的演变。研究采用了大规模数据收集、自然语言处理(NLP)和主题建模等技术,以量化方式分析欧洲新闻在不同国家媒体中的关注度,并揭示其与欧洲一体化进程的关系。
主要观点
- 研究目的:了解欧洲在媒体中的形象和讨论频率,以反映公众舆论和欧洲一体化的历史进程。
- 方法论:结合关键词匹配和主题建模,从海量新闻数据中识别出与“欧洲”相关的文章。该方法不同于以往的“细读”方法,而是采用“远读”(distant reading)策略,以提高分析的可扩展性和效率。
- 数据来源:选择法国(Le Monde)、德国(Der Spiegel)和意大利(La Stampa)的新闻档案,涵盖战后至2019年的新闻内容。
- 技术应用:利用自然语言处理和机器学习技术进行大规模文本分析,包括关键词匹配、主题建模(LDA)和时间序列分析。
- 结果发现:自1990年代初以来,欧洲议题在媒体中的关注度显著上升,这与欧洲一体化的加速相关。通过分析新闻报道的频率(E/T),可以识别出欧洲历史上的关键事件,如欧洲选举、条约签署等。
关键信息
1. 数据收集与处理
- 选择标准:新闻来源需为欧盟创始成员国之一,具有国家代表性,并且拥有从战后时期开始的数字化新闻档案。
- 数据处理:
- 通过OCR技术将扫描文本转化为可读格式。
- 清洗、组织和标准化数据,确保其在时间上的一致性和跨国家的可比性。
- 使用Mallet工具包进行主题建模,以处理大规模数据集。
2. 识别“欧洲”相关文章
- 关键词匹配:构建了包含“欧洲”相关概念和机构的关键词列表,如“欧洲”、“欧盟”、“欧洲委员会”等。
- 关键词评分:
- 每个关键词匹配增加1分。
- “欧元”等词的匹配值为0.5,以减少误判。
- 设置关键词得分阈值为3,低于此值的文章归入“总新闻”(T),高于此值的归入“欧洲新闻”(E)。
- 主题建模:
- 使用LDA(潜在狄利克雷分布)模型识别新闻中的潜在主题。
- 通过排序关键词得分,筛选出“欧洲”相关主题,并排除与欧洲无关的类别(如体育、经济、国际关系等)。
- 将主题分为三类:肯定属于欧洲、可能属于欧洲、不属于欧洲,以减少误判。
3. 分析结果
- 时间趋势:欧洲新闻在1990年代中期显著增加,可能与《马斯特里赫特条约》签署及欧洲一体化进程加快有关。
- E/T比率:
- 通过三种定义方式(简单关键词匹配、严格定义、宽泛定义)计算E/T比率,其中“宽泛定义”是作者偏好的指标。
- 图表显示,欧洲新闻在不同报纸中的关注度存在差异,且与历史事件密切相关。
- 里程碑事件:欧洲选举、条约签署、国际冲突等事件在新闻中频繁出现,表明其对媒体关注的显著影响。
研究意义与局限
- 意义:本文为理解欧洲一体化进程中的媒体角色提供了新的视角,展示了大数据和计算方法在历史研究中的潜力。
- 局限:
- 主题建模未考虑时间维度,因此无法捕捉主题随时间的变化。
- 仍需进一步研究时间变化对主题的影响,以提高分析的深度和精确性。
结论
本文通过量化分析,揭示了欧洲议题在媒体报道中的演变趋势,并指出欧洲一体化进程在1990年代后的显著加速。研究方法具有创新性,为未来欧洲历史、媒体分析和公共舆论研究提供了可借鉴的框架。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载