2025-02-11-加利福尼亚大学伯克利分校-基于内容的图像搜索和检索_9页_7mb
报告摘要
总体介绍
DeepSeek 提出了一种端到端的图像搜索和检索系统,通过自然语言处理技术解决基于文本的语义图像检索问题。该方法将图像和文本嵌入同一语义空间,利用深度学习模型实现高效、准确的查询。
背景和挑战
图像搜索面临内容限制,如令牌数和上下文处理能力不足,以及依赖本地图像库。传统方法多使用手工特征或元数据,易导致误导。DeepSeek 旨在克服这些通过创新的语言模型和特征提取。
方法
方法包括两种检索技术:
- 基于标题的检索:使用 ResNet-101 从图像提取语义特征,并采用生成的图像标题(如 MS COCO 数据集)进行初始化,结合 skip-thought 模型创建文本嵌入,通过 L2 距离排名图像。
- 嵌入空间检索:学习联合图像和文本的深层嵌入空间,图像被投影到语义特征空间,用户查询通过类似处理进行检索,基于 L2 损失优化。
这些方法依赖预训练模型(如 MS COCO caption),使用 LSTM 和 CNN 架构,强调捕捉对象关系和语义。
实验和评估
实验在 MS COCO 数据集上进行,包括 caption 生成和检索评估:
- Caption 生成模型使用残差学习和 skip-thought,定量指标如 CIDEr 达到 SOTA。
- 图像检索性能通过 p@k 指标评估,定性示例显示模型能准确识别对象及其关系。
- 结果表明,嵌入方法在检索中表现更好,捕捉语义优化潜力。
结论与未来工作
DeepSeek 方法在语义图像检索上高效且可靠。未来计划包括 GPU 优化和整合知识图谱以支持更复杂的查询推理。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载