Skip to content

基础机器学习

在深入研究深度学习 (Deep Learning, DL) 之前,了解其基础至关重要:机器学习 (Machine Learning, ML)。人工智能 (Artificial Intelligence, AI) 是创建模仿人类认知功能的机器的广义概念。ML 是 AI 的一个子集,侧重于开发能够根据数据进行学习和决策的系统,而无需针对每个任务进行显式编程。深度学习 (DL) 是 ML 的一个更小的子集,它利用多层神经网络(即深度神经网络)来实现这种学习,通常擅长直接从原始数据中学习复杂的模式。

与深度学习相关的关键机器学习概念包括:

  • 监督学习 (Supervised Learning): 从带标签的数据中学习。算法被给予输入-输出对(例如,标记为“猫”或“狗”的图像,带有销售价格的历史房屋数据)。目标是学习一个映射函数,该函数可以预测新的、未见过的输入的输出。常见任务包括:
    • 分类 (Classification): 预测离散的类别标签(例如,垃圾邮件/非垃圾邮件,猫/狗/鸟,客户流失/不流失)。
    • 回归 (Regression): 预测连续的数值(例如,预测房价、股票价值、温度)。
  • 无监督学习 (Unsupervised Learning): 从无标签的数据中学习。算法试图在没有预定义输出的情况下,发现数据中固有的结构、模式或关系。常见任务包括:
    • 聚类 (Clustering): 将相似的数据点分组在一起(例如,客户细分,将相似的新闻文章分组)。
    • 降维 (Dimensionality Reduction): 在保留重要信息的同时减少输入变量的数量(例如,主成分分析 - PCA,自编码器 - Autoencoders)。
    • 异常检测 (Anomaly Detection): 识别稀有或不寻常的数据点(例如,欺诈检测,识别有缺陷的产品)。
  • 强化学习 (Reinforcement Learning, RL): 通过与环境交互进行试错学习。一个“代理”(agent)在环境中采取行动,根据这些行动接收奖励或惩罚,并学习一个策略(strategy)以随时间最大化其累积奖励。用于机器人学、游戏和控制系统。
  • 自监督学习 (Self-Supervised Learning): 一种无监督学习,其中标签是自动从输入数据本身生成的。例如,根据周围的词语预测句子中被遮盖的词(如 BERT 中),或预测视频中的下一帧。

深度学习特别擅长监督学习和自监督学习任务,通常构成核心模型架构。

  • 特征 (Features) 和标签 (Labels): 用于预测的输入变量称为特征。我们想要预测的输出变量是标签(在监督学习中)。
  • 训练集 (Training Set)、验证集 (Validation Set) 和测试集 (Test Set): 数据通常被分割为:
    • 训练集 (Training Set): 用于训练模型(调整其参数)。
    • 验证集 (Validation Set): 在训练过程中用于调整超参数(例如,学习率 learning rate、网络架构)和监控过拟合(overfitting)(例如,用于早期停止 early stopping)。
    • 测试集 (Test Set): 仅在训练完成后使用,用于对最终模型在未见过的数据上的性能提供无偏评估。
  • 损失函数 (Loss Function)(成本函数 Cost Function): 衡量模型预测与实际标签之间差异(误差)的函数。训练的目标是最小化此函数(例如,回归任务使用均方误差 Mean Squared Error,分类任务使用交叉熵 Cross-Entropy)。
  • 优化算法 (Optimization Algorithm): 用于调整模型参数以最小化损失函数的方法(例如,梯度下降 Gradient Descent 及其变体如 Adam、RMSprop)。
  • 超参数 (Hyperparameters): 在训练开始之前设置的参数,它们定义了模型的结构或训练过程本身(例如,层数、每层的神经元数量、学习率 learning rate、批量大小 batch size、正则化强度 regularization strength)。它们不是直接从数据中学习的,但通常使用验证集进行调整。
  • 过拟合 (Overfitting) 和欠拟合 (Underfitting):
    • 过拟合 (Overfitting): 模型对训练数据学习得太好,包括噪声和特定细节,导致在新数据上表现不佳。模型具有高方差 (variance)。
    • 欠拟合 (Underfitting): 模型过于简单,无法捕获数据中的底层模式,导致在训练数据和测试数据上表现均不佳。模型具有高偏差 (bias)。
  • 正则化 (Regularization): 用于通过向模型添加约束或惩罚来防止过拟合的技术(例如,L1/L2 正则化、Dropout、早期停止 Early Stopping、数据增强 Data Augmentation)。

一个关键的区别在于特征工程 (feature engineering)。在传统 ML 中(例如,支持向量机 SVM、逻辑回归 Logistic Regression、决策树 Decision Trees),通常需要大量精力从原始数据中手动提取相关的特征。模型性能严重依赖于这些手工设计的特征的质量。

深度学习模型,特别是其层次结构,擅长自动特征学习 (automatic feature learning)。它们可以通过其层直接从原始数据(如图像中的像素或文本中的单词)学习相关的特征。较低层学习简单的特征,较高层将它们组合成更复杂、更抽象的表示。这种自动学习特征的能力是 DL 在处理图像、音频和文本等非结构化数据的复杂任务上取得巨大成功的主要原因。

然而,这需要比许多传统 ML 算法更大的数据集和更多的计算资源。