Skip to content

StyleGAN 和 CycleGAN

现代图像生成:CycleGAN 与 StyleGAN

Section titled “现代图像生成:CycleGAN 与 StyleGAN”

本章探讨 CycleGAN 和 StyleGAN,这两种极具影响力的生成对抗网络(GAN)架构,它们以其在图像翻译和高保真图像合成方面的独特能力而闻名。理解这些模型有助于深入了解先进的生成技术。

什么是 CycleGAN(循环一致性生成对抗网络)?

Section titled “什么是 CycleGAN(循环一致性生成对抗网络)?”

CycleGAN 是一个开创性的 GAN 框架,专为非配对图像到图像翻译而设计。这意味着它可以学习将图像从源域 X 转换到目标域 Y(反之亦然),而无需训练数据集中图像之间存在直接的一对一对应关系。例如,它可以学习将马的照片变成斑马,或者将夏季场景变成冬季场景,即使没有直接的“之前和之后”的配对图像。

与早期通常需要配对训练数据(例如,特定的低分辨率图像及其高分辨率对应图像)的 GAN 不同,CycleGAN 的创新之处在于它能够以无监督的方式学习两个不同图像域之间的映射。

CycleGAN 的核心思想围绕循环一致性。它确保如果一个图像从域 A 翻译到域 B,然后再翻译回域 A,结果应该接近原始图像。让我们分解一下:

  • 假设你有一个来自域 A 的图像“x”。生成器“G_AB”将其翻译成域 B 中的图像“y_hat”:G_AB(x) = y_hat。
  • 然后,另一个生成器“G_BA”将“y_hat”翻译回域 A,生成“x_reconstructed”:G_BA(y_hat) = G_BA(G_AB(x)) = x_reconstructed。
  • 循环一致性损失衡量“x_reconstructed”与原始“x”的相似程度。对于从域 B 开始的图像,也会发生类似的过程。

CycleGAN 使用两对生成器和判别器,并辅以至关重要的循环一致性损失:

CycleGAN 使用两个生成器网络:G_AB 将图像从域 A 翻译到域 B,G_BA 将图像从域 B 翻译回域 A。这些网络通常使用对图像转换有效的架构构建,例如包含残差块的架构。

同样,有两个判别器网络:D_A 区分来自域 A 的真实图像和由 G_BA 翻译到域 A 的图像。D_B 对域 B 和由 G_AB 生成的图像执行相同操作。它们提供对抗损失,促使生成器创建逼真的图像。

这是 CycleGAN 的基石。它强制要求图像在被翻译到另一个域并返回后,应该重建原始图像。在数学上,这种损失惩罚诸如 ||G_BA(G_AB(x)) - x|| 和 ||G_AB(G_BA(y)) - y|| 之类的差异。这可以防止模型学习微不足道的解决方案(例如,忽略输入并生成目标域中任何逼真的图像),并有助于在翻译过程中保留原始图像的内容。

从视觉上看,CycleGAN 架构包含两个主要路径。一条路径从域 A 获取图像,使用生成器 G_AB 将其翻译到域 B,然后尝试使用生成器 G_BA 重建原始域 A 图像。判别器 D_B 检查翻译后的域 B 图像的逼真度。第二条路径镜像此过程,从域 B 的图像开始,使用 G_BA 翻译到域 A(由 D_A 检查),然后再使用 G_AB 返回域 B。循环一致性损失应用于两个重建步骤的末尾,确保生成的图像保留原始输入的关键特征。

CycleGAN 执行非配对图像到图像翻译的能力使其在各种应用中得以应用:

  • 风格迁移: 将艺术风格(例如,莫奈、梵高)迁移到照片,将照片转换为绘画,将白天场景转换为夜间场景,或将航空照片转换为地图状表示。
  • 领域适应: 使在合成数据(更容易生成)上训练的模型适应真实世界数据,从而提高在目标检测和语义分割等任务中的性能,而这些任务的带标签真实世界数据很少。
  • 数据增强: 通过将现有图像翻译成不同的风格或条件来生成新的训练样本,从而丰富数据集以训练更强大的模型。
  • 图像增强: 提高图像质量,例如为黑白照片上色(如果域是黑白和彩色)或增强细节,尽管专门模型通常在这些任务上表现更好。

什么是 StyleGAN(基于风格的生成对抗网络)?

Section titled “什么是 StyleGAN(基于风格的生成对抗网络)?”

StyleGAN 由 NVIDIA 开发,是一种 GAN 架构,专门用于生成具有前所未有的对不同细节级别视觉风格控制能力的高分辨率、逼真图像。它显着提升了图像合成领域的最新技术水平,尤其是在人脸生成方面。

StyleGAN 引入了创新技术,可以更直观地控制生成图像的特定属性(例如,姿势、发型、面部特征),并改善了这些属性在潜在空间中的解耦。

StyleGAN 基于渐进式 GAN 架构,但引入了显着修改,尤其是在生成器中:

StyleGAN 最初采用了渐进式增长策略,即生成器和判别器网络首先训练生成低分辨率图像,然后逐渐增加尺寸和复杂性以生成更高分辨率图像(例如,早期版本高达 1024x1024 像素)。这稳定了高分辨率输出的训练。

StyleGAN 没有直接将潜在代码“z”输入合成网络,而是首先使用非线性映射网络(多层感知器)将“z”(来自标准高斯分布)映射到中间潜在空间“w”。发现这个“W”空间更加解耦,这意味着“w”向量的变化更可预测地对应于图像中的特定语义属性。

合成网络与自适应实例归一化 (AdaIN)

Section titled “合成网络与自适应实例归一化 (AdaIN)”

合成网络从学习到的常数输入生成图像。“w”向量(风格输入)通过自适应实例归一化(AdaIN)控制合成网络不同层的视觉风格。AdaIN 通过根据源自“w”的风格信息对每个卷积层的特征图进行缩放和偏差调整来修改特征图。这允许在不同尺度上对纹理、颜色和图案等风格方面进行精细控制。

在训练过程中,StyleGAN 使用风格混合,其中使用两个不同的潜在代码“w1”和“w2”来生成图像。来自“w1”的风格可能控制粗糙特征(例如,姿势、脸型),而来自“w2”的风格控制更精细的细节(例如,发质、肤色)。这种正则化技术鼓励更好的解耦和泛化。

后续版本 StyleGAN2 和 StyleGAN3 引入了进一步改进:StyleGAN2 通过重新设计归一化和正则化来解决常见伪影(如水滴伪影)并提高图像质量。StyleGAN3 则专注于实现平移和旋转的等变性,使生成器在这些变换下表现更具可预测性,这对于视频和动画至关重要。

StyleGAN 的能力已应用于众多领域:

生成高度逼真的人脸、动物、汽车和其他物体。这对于创建合成数据集、艺术作品以及游戏和虚拟环境中的角色生成非常有价值。

由于其解耦的潜在空间,StyleGAN 允许通过操纵潜在向量直观地编辑图像属性,如年龄、性别、表情、发色等。这被用于“人脸编辑”应用程序和创意工具中。

将“风格”(纹理、颜色、高级特征)从一个图像迁移到另一个图像,甚至在不同领域之间进行迁移(例如,让真实人脸看起来像卡通人物)。

生成多样化的服装设计、纹理和风格。在虚拟试穿应用、产品可视化和时尚设计探索中非常有用。

虽然 StyleGAN 功能强大,但其逼真度也引发了对深度伪造的担忧。伦理准则和检测方法对于减轻滥用至关重要。有关 AI 伦理的进一步阅读,请参阅 AI Ethics Lab 或 Partnership on AI 等组织的资源。

CycleGAN 和 StyleGAN 代表了生成式 AI 领域的重大里程碑。CycleGAN 通过巧妙地利用循环一致性,擅长非配对图像到图像翻译。StyleGAN 及其后续版本则将逼真图像生成和风格控制的界限进一步推向了前沿。

理解它们的架构和创新有助于深入了解它们的能力以及 GAN 在创建和操纵视觉内容方面的更广泛潜力。随着研究的进展,这些基础模型将继续激发生成建模领域的新技术创新。