Skip to content

ML 与 生成式AI

机器学习、深度学习及其在生成式AI中的作用

Section titled “机器学习、深度学习及其在生成式AI中的作用”

OpenAI 发布了诸如 ChatGPT(大型预训练 Transformer 模型)之类的高级 AI 系统,极大地提升了公众对人工智能的兴趣。这些工具展示了 AI 在自然人机交互和复杂内容生成方面的日益增长的能力。

AI 的快速发展正在深刻影响社会和经济,将 AI 定位为塑造我们未来的关键技术。生成式 AI,作为 ChatGPT 和复杂图像生成器等工具背后的驱动力,本身建立在基础领域之上:机器学习(ML)和深度学习(DL)。

本章概述了 ML 和 DL,解释了这些核心概念如何与现代生成式 AI 的能力紧密相连。

人工智能(AI)是一个广泛的领域,包含使机器能够模仿人类智能和能力的任何技术。在 AI 内部,机器学习(ML)是一个子领域,专注于使系统能够从数据中学习的算法。深度学习(DL)是 ML 的一个子集,利用具有多层的人工神经网络(深度神经网络)从大量数据中学习复杂的模式。生成式 AI 是 DL 的一个专门分支,专注于根据从现有数据中学习到的模式创建新的、原创的内容(文本、图像、音频等)。这种层级关系(AI > ML > DL > 生成式 AI)说明了每个领域如何在前一个领域的基础上构建。

作为最新演变,生成式 AI 正在重塑创造力和创新。本章将简要探讨其在机器学习、其子类型和深度学习中的基础。

机器学习(ML)是人工智能的一个子集,它使计算机系统能够从数据中学习并在特定任务上改进其性能,而无需为每个案例进行显式编程。ML 算法识别数据中的模式以构建可以进行预测或决策的模型。

根据学习方法和数据可用性,ML 大致分为:

在监督学习中,算法在一个带标签的数据集上进行训练,其中每个输入数据点都与正确的输出或标签配对。模型的目的是学习一个映射函数,该函数可以预测新的、未见过的输入的输出。常见任务包括分类(预测类别)和回归(预测连续值)。

无监督学习涉及在一个无标签的数据集上训练模型。算法尝试自行发现数据中隐藏的模式、结构或关系。常见任务包括聚类(将相似数据点分组)、降维(减少变量数量)和关联规则挖掘。

在强化学习(RL)中,一个智能体通过与环境交互来学习做出一系列决策。智能体根据其行动接收奖励或惩罚形式的反馈。目标是学习一种策略(选择行动的策略),该策略能够最大化随时间累积的奖励。这在机器人、游戏和优化问题中很常见。

机器学习原则是生成式 AI 模型运行的基础:

生成式 AI 模型,特别是在早期开发或针对特定任务时,通常使用监督学习技术。它们通过理解所提供输入(提示、条件)与所需输出(生成的文本、图像)之间的关系来学习生成内容。

无监督学习对于生成式 AI 发现大型数据集中的底层模式、分布和结构至关重要。这使得模型能够生成与学习到的数据特征一致的新颖内容,即使没有为每个所需输出提供明确的标签。

适应性对于生成式 AI 至关重要,特别是对于需要持续改进的任务。强化学习,尤其是基于人类反馈的强化学习(RLHF),是一种用于微调大型语言模型等生成模型的核心技术。RLHF 涉及使用人类反馈来引导模型生成更有用、无害且符合用户期望的输出。这种迭代反馈循环有助于提高生成内容的质量和安全性。

生成式 AI 模型依赖于 ML 优化技术(例如梯度下降及其变种)来在训练过程中微调其庞大的参数数量。这个过程最小化损失函数,从而提高模型的性能以及生成准确连贯内容的能力。

许多最先进的生成式 AI 模型利用迁移学习。一个大型基础模型在海量的通用数据集(例如,互联网上的大量文本和代码)上进行预训练。然后,这个预训练模型作为基础,可以在较小的、特定任务的数据集上进行微调,显著加速学习并提高特定内容生成任务的性能。

深度学习(DL)是 ML 的一个专门子集,其灵感来源于人脑神经网络的结构和功能。它采用具有多层(因此称为“深度”)的**人工神经网络(ANNs)**来自动学习数据的分层表示,并从原始输入中提取复杂特征。

与传统 ML 算法相比,深度学习算法通常需要较少的人工特征工程,因为它们可以直接从数据中学习相关特征。它们在大数据集上表现出色,并在计算机视觉、自然语言处理和语音识别等领域取得了突破。

以下是深度学习如何支撑生成式 AI 的:

为了生成复杂多样的内容,生成式 AI 模型必须学习数据的分层表示(从低级特征到高级概念)。深度神经网络凭借其多层结构,天然适合此任务,允许模型理解和重构复杂的数据结构。

CNNs 是一种 ANNs,对于处理网格状数据(如图像)非常有效。它们使用卷积层自动学习特征的空间层次结构。生成式 AI 模型,特别是用于图像生成(例如在 GANs 和 Diffusion Models 中)和分析的模型,大量使用 CNNs 来提取视觉特征,并促进文本到图像生成等任务。

循环神经网络(RNNs)和序列数据

Section titled “循环神经网络(RNNs)和序列数据”

RNNs 及其变种(如 LSTMs 和 GRUs)传统上用于文本和时间序列等序列数据,因为它们可以保持对过去输入的“记忆”。尽管 Transformers 在许多 NLP 任务中已很大程度上取代了 RNNs,因为它们能更好地处理长距离依赖和并行化,但 RNNs 仍在某些生成任务中找到应用,或作为序列建模的重要历史背景。

训练最先进的生成式 AI 模型需要处理和学习海量数据集。深度学习框架和架构旨在有效应对数据规模的扩展,使这些模型能够学习丰富而复杂的数据分布。

生成对抗网络(GANs)及其他生成式架构

Section titled “生成对抗网络(GANs)及其他生成式架构”

GANs 是一种著名的深度学习架构,专门为生成建模而设计。其他基于深度学习的生成模型包括变分自编码器(VAEs)以及最近的 Diffusion Models。这些架构利用深度神经网络来学习数据分布并生成新颖样本。

本章概述了 AI、机器学习、深度学习和生成式 AI 之间的层级关系。我们回顾了 ML(监督学习、无监督学习、强化学习)和 DL(ANNs、CNNs、RNNs)的核心概念,并强调了它们对现代生成式 AI 卓越能力的贡献。

显然,机器学习和深度学习的原理和技术是生成式 AI 构建的不可或缺的基础。随着这些基础领域的不断发展,它们必将进一步推动创新,并在各种应用中释放生成式 AI 的全部潜力。