2017年-数据局_苹果首份人工智能报告_16页_1mb
报告摘要
总结:Learning from Simulated and Unsupervised Images through Adversarial Training
核心内容
本文提出了一种新的学习方法 Simulated+Unsupervised (S + U) 学习,通过使用未标注的真实图像来提升模拟器生成图像的逼真度,同时保留模拟器的标注信息。该方法基于对抗训练,结合了自正则化损失,以确保生成图像既逼真又保留关键的标注信息。这种方法可以用于训练各种机器学习模型,而无需真实数据的标注,从而降低了数据标注的成本。
主要观点
- S + U 学习的目标:使用未标注的真实图像来改进模拟器生成的合成图像的逼真度,同时保留其标注信息。
- 对抗训练框架:本文提出的方法名为 SimGAN,其核心思想是通过对抗网络训练一个“refiner network”,以增强合成图像的视觉质量。
- 自正则化损失:为了保持合成图像的标注信息,本文引入了自正则化损失,该损失最小化合成图像与精炼后图像之间的差异。
- 局部对抗损失:为了解决全局对抗损失可能引入的不真实细节(如边缘噪声和深度边界伪影),本文使用了局部对抗损失,通过在图像的局部区域上进行分类,提高了训练的稳定性和图像质量。
- 历史图像更新机制:为了增强对抗训练的稳定性,本文采用历史图像更新机制,即使用之前生成的精炼图像来更新判别器,而不是仅依赖当前批次的图像。
- 实验验证:本文在 MPIIGaze 数据集和 NYU 手势数据集上进行了实验,展示了 S + U 学习方法在提高图像逼真度和模型泛化能力方面的有效性。
关键信息
方法概述
-
SimGAN 是一种用于 S + U 学习的对抗训练框架,包含两个主要网络:refiner network (R) 和 discriminator network (D)。
-
R 用于生成更逼真的合成图像,D 用于判断图像是否为真实图像。
-
R 通过最小化对抗损失和自正则化损失进行训练,公式如下:
$$
\mathcal{L}R(\boldsymbol{\theta}) = - \sum_i \log\left(1 - D{\phi}(R_{\boldsymbol{\theta}}(\mathbf{x}i))\right) + \lambda | R{\boldsymbol{\theta}}(\mathbf{x}_i) - \mathbf{x}_i |_1
$$ -
D 通过训练多个局部区域的图像分类器来避免全局不稳定性,并使用历史图像更新机制,以提高判别器的鲁棒性。
实现细节
- Refiner Network (R):使用 ResNet 结构,包含 4 个 ResNet 块,每个块由两个卷积层组成,输出 64 个特征图。
- Discriminator Network (D):包含 5 个卷积层和 2 个最大池化层,最终通过 softmax 层输出图像为真实或合成的概率。
- 训练策略:在每个训练步骤中,更新 D 时使用历史图像和当前批次图像的组合,以提高训练稳定性。
实验结果
- MPIIGaze 数据集:使用 SimGAN 精炼后的合成图像进行训练,显著提升了 gaze 估计的性能。在 7 度误差的评估中,相比使用原始合成图像,误差降低了 2.1 度,相对提升 21%。
- 用户研究:通过“视觉图灵测试”验证了生成图像的逼真度。在 1000 次测试中,平均人类分类准确率为 51.7%,表明生成图像与真实图像难以区分。
- 定量评估:在 MPIIGaze 数据集上,使用 SimGAN 精炼图像训练的 CNN 模型表现优于所有基于合成图像或真实图像的现有方法。
结构清晰点
- 对抗损失:用于使生成图像尽可能接近真实图像。
- 自正则化损失:用于保留合成图像的标注信息,防止图像内容发生不合理的改变。
- 局部对抗损失:避免全局不稳定性,提高图像质量。
- 历史图像更新:增强训练稳定性,防止判别器遗忘已学习的特征。
- 应用领域:适用于 gaze 估计、手部姿态估计等任务,无需真实数据标注即可训练高性能模型。
结论
本文提出的 SimGAN 方法通过对抗训练和自正则化策略,成功地提升了合成图像的逼真度,同时保留了关键的标注信息。实验结果表明,该方法在多个任务中表现出色,能够显著提高模型的泛化能力,为无需标注数据的训练提供了新的解决方案。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载