微软-matrix51_40页_132mb
报告摘要
Matrix 2019年10-12月 第51期 总结
核心内容
本期《Matrix》聚焦微软亚洲研究院在人工智能领域的前沿研究与技术应用,内容涵盖AI换脸鉴别、NLP技术突破、自动机器学习工具NNI的更新、Excel智能数据分析功能的推出,以及语音增强与视频内容片段检测等技术进展。
主要观点
- AI换脸技术的挑战与应对:随着DeepFake等AI换脸技术的普及,虚假信息传播成为社会问题。微软亚洲研究院开发了换脸鉴别算法,其识别率远超人类和业界现有水平,且能识别未知换脸技术。
- 统一预训练语言模型UniLM:微软在NLP领域取得突破,UniLM支持自然语言理解和生成任务,且在SQuAD和CoQA数据集上均超越人类水平。
- 开源自动机器学习工具NNI:NNI支持多种机器学习框架和平台,提供完整的机器学习生命周期自动化支持,包括特征工程、NAS、超参调优和模型压缩等,并拥有完整的中文文档。
- Excel对话式数据分析:微软亚洲研究院开发了AnnaParser算法,使Excel能够通过自然语言进行数据分析,降低了使用门槛,提高了效率。
- 语音增强模型PHASEN:该模型通过双流结构和频域变换模块(FTB),有效提升了语音降噪效果,在多个数据集上表现优异。
- 二维时间图的视频内容片段检测:微软提出2D-TAN模型,通过二维时间图建模,提高了视频内容定位和人体动作检测的准确性。
关键信息
AI换脸鉴别
- 技术挑战:DeepFake等换脸技术的普及带来虚假信息风险,人类识别率低。
- 解决方案:微软开发的换脸鉴别算法基于FaceForensics数据库,支持多种换脸技术。
- 识别率:
- DeepFake: 99.87%
- FaceSwap: 99.66%
- Face2Face: 99.67%
- 通用模型:可同时鉴别不同类型的换脸技术,提升对未知算法的适应性。
NLP研究突破
- 统一预训练语言模型UniLM:支持自然语言理解和生成,已在NeurIPS、ACL、EMNLP等顶级会议发表。
- 机器阅读理解:微软在SQuAD和CoQA数据集上取得突破,使机器阅读理解能力超越人类水平。
自动机器学习工具NNI
- 功能与优势:
- 支持多种主流框架(如PyTorch、TensorFlow等)。
- 提供分布式训练支持,可适配Kubernetes等平台。
- 支持特征工程、NAS、超参调优、模型压缩等全生命周期任务。
- 提供可视化界面和中文文档。
- 超参优化:支持多种优化算法,包括TPE、SMAC、进化算法等。
- 模型压缩:支持9种模型压缩算法,包括AGP、L1Filter、Slim等。
Excel智能数据分析
- 技术实现:微软亚洲研究院开发了AnnaParser算法,提升Excel的自然语言处理能力。
- 功能特点:
- 自动识别表格实体与语义。
- 结合语义规则与深度学习算法,实现自底向上的逻辑表达。
- 提供多语言支持,降低使用门槛。
- 应用场景:支持用户通过自然语言提问,Excel自动进行数据分析并以图表形式呈现结果。
语音增强模型PHASEN
- 技术亮点:
- 双流结构:分别处理强度和相位信息。
- 频域变换模块(FTB):提升对谐波相关性的捕捉能力。
- 实验结果:
- 在AVSpeech+Audioset数据集上,SDR提升1.76dB。
- 在Voice Bank+DEMAND数据集上,多个指标优于其他模型。
- 未来方向:优化延迟与模型参数量,拓展应用到语音分离等任务。
视频内容片段检测
- 技术突破:提出二维时间图(2D-TAN)模型,用于视频内容定位和人体动作检测。
- 方法优势:
- 通过二维时间图建模,捕捉时间片段之间的依赖关系。
- 在HACS Temporal Action Localization Challenge中获得第一名。
- 实验结果:
- 在Charades-STA、ActivityNet Captions、TA-CoS数据集上表现优异。
- 在Rank1@0.5和Rank5@0.5指标上分别提升5和14个百分点。
总结
微软亚洲研究院在2019年第四季度持续推进AI技术的创新与应用,涵盖NLP、机器学习、语音处理、视频分析等多个领域。通过技术突破与开源工具的发布,微软不仅提升了自身产品的智能化水平,也为整个行业提供了可借鉴的研究成果与解决方案。同时,研究院强调AI技术的社会责任,倡导构建可信赖的AI系统,以技术手段应对虚假信息、隐私泄露等问题,推动AI技术在社会中的积极应用。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载