美国安全与新兴技术中心CSET2024识别研究中的新兴技术报告英文版15页_1mb
报告摘要
这份报告由Center for Security and Emerging Technology团队发布,旨在通过两种创新方法识别与新兴技术相关的科研领域。背景部分指出科学文献分类面临挑战,传统学科划分难以涵盖快速演化的新兴技术领域(如AI),且现有分类工具常依赖静态学科标准,无法有效捕捉跨学科研究动态。团队开发了机器学习模型预测出版物与新兴技术主题(网络安全、大语言模型开发、芯片设计与制造)的相关性,并构建了覆盖L0-L3层级的科研领域评分体系。
第一种解决方案基于文本嵌入与余弦相似度,利用预训练的FastText模型生成领域文本向量,对比科研文献的文本向量以评估相关性。第二种方法采用零样本分类框架,通过Prompt工程指导生成式AI模型(如Gemini 1.5 Flash)完成领域分类。经测试,网络安全相关文献识别准确率达80%(精确度0.8,召回率0.75,F1值0.77),大语言模型领域识别精确度88%(F1值0.93),芯片设计领域召回率73%(F1值0.79)。所有分析基于包含2.6亿篇论文的合并学术语料库,通过Apache Airflow和Apache Beam构建数据处理流程,并采用去重算法确保数据质量。
团队还扩展了领域分类体系,从原Microsoft Academic Graph的19个L0领域(如计算机科学、生物学)细化至1,108个L1-L3领域,重点覆盖人工智能、网络安全、半导体、基因技术等关键技术领域。通过t-SNE可视化技术,发现领域间存在直观聚类(如人工智能与人机交互、计算机安全与网络技术等),验证了分类系统的有效性。最终成果包括公开数据集与交互式分析工具,如Research Almanac、Map of Science、Private-sector AI-Related Activity Tracker(PARAT)和Country Activity Tracker(CAT),为研究者提供新兴技术研究动态的实时监测能力。研究数据来源于OpenAlex、Semantic Scholar等开放平台,所有成果通过GitHub和Zenodo公开共享,支持学术研究与政策分析。
试读结束,高清完整版pdf/doc/ppt,请点下载