机器学习 - 分类
机器学习 - 类别
Section titled “机器学习 - 类别”机器学习 (Machine Learning) 根据学习系统可用的学习信号或反馈 (learning signal or feedback) 的性质大致分类。主要类别通常被视为人工智能 (AI) 发展的演进路径 (evolutionary path):
概念上的演进通常遵循这条路径:从监督学习 (Supervised Learning) 开始,随着数据增长转向无监督学习 (Unsupervised Learning),然后探索强化学习 (Reinforcement Learning) 进行交互式决策。随着大数据的出现和强大的计算能力,深度学习 (Deep Learning) 崛起,然后与强化学习结合创建了深度强化学习 (Deep Reinforcement Learning)。
- 监督学习:从标记数据 (labeled data) 中学习。
- 无监督学习:在未标记数据 (unlabeled data) 中发现模式。
- 强化学习:通过奖励和惩罚进行试错学习 (trial and error)。
- 深度学习:使用多层神经网络 (multi-layered neural networks) 的子领域,可应用于监督、无监督和强化学习范式。
- 深度强化学习:结合深度学习和强化学习,解决复杂的决策问题。
接下来,我们将更详细地探讨这些类别。
监督学习类似于学生与老师一起学习。“老师”提供标记样本 (labeled examples),“学生”(模型)学习将输入映射到输出。例如,如果你教孩子识别动物,你会给他们看图片(输入)并告诉他们每种动物的名字(标签)。
在回归 (regression) 任务中,目标是预测连续输出值 (continuous output value)。你向模型提供输入特征 (input features) 及其对应的连续目标值 (corresponding continuous target values) 的示例(例如,对于输入特征 x1,输出是 y1;对于 x2,输出是 y2)。根据这些数据,模型学习 X 和 Y 之间的经验关系 (empirical relationship)。训练完成后,你可以要求模型预测新的、未见过的数据 X (unseen X) 的 Y 值。前面讨论的房价预测示例就是一个经典的回归问题。
在分类 (classification) 任务中,目标是预测类别输出标签 (categorical output label)。你使用每个输入都关联特定类别 (specific class) 的示例来训练模型。例如,要将电子邮件分类为“垃圾邮件” (spam) 或“非垃圾邮件” (not spam),你会提供已相应标记的电子邮件(输入)。训练后,模型可以对新的、未标记的电子邮件 (unlabeled emails) 进行分类。另一个例子:根据学生的身高将他们分组为“矮”、“中等”和“高”。从标记样本中学习后,模型可以对新学生进行分类。
监督学习是最早也是最成功的机器学习范式 (ML paradigms) 之一,已开发出许多算法并有效应用于各个领域,如手写识别 (handwriting recognition) 和图像医学诊断 (medical diagnosis from images)。
在无监督学习 (Unsupervised learning) 中,模型接收未标记数据 (unlabeled data),必须自行发现模式或结构。我们不提供目标变量;相反,我们可能会问机器:“你能告诉我关于这些数据的信息吗?”或者“这些数据中有哪些自然的分组?”。常见的任务包括聚类 (clustering)(例如,根据购买行为对客户进行细分)和降维 (dimensionality reduction)(例如,在保留重要信息的同时简化复杂数据)。无监督学习通常需要大量数据才能发现有意义的模式。想象一个散点图,其中混合了未着色的数据点。一个无监督的聚类算法可以在这些点中识别出不同的组或簇 (clusters),并在它们之间绘制边界,揭示数据中的底层结构,而无需事先提供标签。
无监督学习在异常检测 (anomaly detection)、文本主题建模 (topic modeling) 以及后续监督任务的特征学习 (feature learning) 等应用中取得了巨大成功。
强化学习 (Reinforcement Learning, RL) 涉及一个“智能体” (agent),它学习在“环境” (environment) 中做出 последовательная решений,以最大化累积“奖励” (cumulative ‘reward’)。这就像训练宠物狗:当狗执行期望的动作(例如,捡球)时,它会收到奖励(例如,零食)。随着时间的推移,狗学会哪些动作会带来奖励。类似地,RL 智能体通过执行动作与环境交互。环境通过转移到新状态并提供奖励或惩罚来响应。智能体学习一种“策略” (policy)——一种选择动作的策略——以最大化其随时间推移的总预期奖励。这通常涉及平衡“探索” (exploration)(尝试新动作以发现更好的奖励)和“利用” (exploitation)(使用已知的良好动作)。经典应用包括游戏对弈 (game playing)(例如 AlphaGo)和机器人控制 (robotics control)。
这个学习过程可以被看作一个循环:智能体观察环境的状态 (environment’s state),根据其当前策略采取行动,接收奖励并观察新状态,然后根据此反馈 (feedback) 更新其策略。
深度学习 (Deep Learning) 是机器学习的一个子领域 (subfield),基于具有多层(深度架构 (deep architectures))的人工神经网络 (Artificial Neural Networks, ANNs)。这些网络,特别是卷积神经网络 (Convolutional Neural Networks, CNNs)、循环神经网络 (Recurrent Neural Networks, RNNs) 和 Transformer 模型 (Transformers) 等架构,可以自动学习数据的分层表示 (hierarchical representations)。深度学习在计算机视觉 (computer vision)、语音识别 (speech recognition)、自然语言处理 (natural language processing) 等领域取得了突破。它通常需要大型数据集和显著的计算能力 (computational power)(通常是 GPU 或 TPU)进行训练。
深度强化学习
Section titled “深度强化学习”深度强化学习 (Deep Reinforcement Learning, DRL) 将深度学习与强化学习相结合。深度神经网络用作 RL 框架中的函数逼近器 (function approximators),例如,用于表示策略或价值函数 (value function)。这使得 RL 智能体能够在复杂的高维环境 (high-dimensional environments) 中学习(如从原始像素输入 (raw pixel inputs) 控制视频游戏或控制复杂机器人 (sophisticated robots))。DRL 在传统 RL 之前难以处理 (intractable) 的领域取得了显著进展,推动了 AI 在机器人、游戏对弈、资源管理 (resource management) 等领域的边界。DRL 的研究非常活跃并不断推动创新。
回顾了这些类别后,我们现在可以更深入地研究每个类别中的具体算法和技术。