Skip to content

基础知识

我们生活在一个由数据定义的时代,计算能力的不断提升和巨大的存储能力为此提供了动力。这种不断增长的信息量带来了一个挑战:我们如何从中提取有意义的洞察和知识?数据科学 (Data Science)、数据挖掘 (Data Mining),尤其是机器学习 (Machine Learning) 等领域提供了构建从数据中学习的智能系统的方法。

机器学习 (Machine Learning, ML) 是人工智能 (Artificial Intelligence, AI) 的一个子领域,专注于开发能够从数据中学习并基于数据做出决策的系统,而无需为每个任务进行显式编程。

本质上,机器学习算法识别数据中的模式。其核心目标是使计算机系统能够从经验中学习,随时间推移提升其在特定任务上的表现,就像人类一样。

尽管人类智能在许多复杂的推理任务中仍然无与伦比,但机器学习解决了高效且规模化地分析海量数据集并做出数据驱动决策的需求。人类可能难以处理数十亿数据点,但机器可以。

组织越来越多地利用机器学习来自动化流程、获取洞察,并解决以前难以解决的问题。机器学习模型从数据本身学习规则,而不是仅仅依赖于硬编码的规则(这些规则可能脆弱且难以维护)。这对于以下情况尤其有价值:

  • 具有人类不易察觉的复杂模式的问题。
  • 需要适应不断变化数据的任务。
  • 大规模自动化重复性决策过程。
  • 个性化(例如,推荐系统)。

在传统编程力有不逮的场景中,机器学习尤其有效:

对于图像识别、自然语言处理或垃圾邮件过滤等任务,编写显式规则来涵盖所有可能性几乎是不可能的。机器学习算法可以从示例中学习这些复杂模式。

在模式随时间变化的场景中(例如,金融市场、用户行为、网络流量),机器学习模型可以通过持续学习新数据来适应(在线学习,online learning)。

机器学习技术可以高效处理具有众多特征的海量数据集,揭示手动无法发现的洞察。

机器学习驱动着根据个人用户定制体验的系统,例如电影推荐 (Netflix)、产品推荐 (Amazon) 或个性化新闻推送。

Tom Mitchell 提出的一个广为人知的定义有助于形式化学习的概念:

“如果一个计算机程序在任务类 T 上的性能(以性能度量 P 衡量)随着经验 E 的增加而提高,那么就称该程序从经验 E 中学习。”

这突出了任何机器学习系统的三个关键组成部分:

机器学习系统旨在解决的特定问题。示例包括:

  • 分类 (Classification): 将数据点分配到预定义的类别(例如,将电子邮件分类为垃圾邮件/非垃圾邮件)。
  • 回归 (Regression): 预测连续的数值(例如,预测房价)。
  • 聚类 (Clustering): 在没有预先标签的情况下将相似数据点分组(例如,客户细分)。
  • 转录 (Transcription): 将非结构化数据转换为文本(例如,语音转文本)。
  • 异常检测 (Anomaly Detection): 识别异常数据点(例如,欺诈检测)。

算法用于学习和改进的数据。这种经验的性质定义了学习范式(监督学习 (supervised learning)、无监督学习 (unsupervised learning)、强化学习 (reinforcement learning))。算法处理这些数据以识别模式、关系或最优策略。

用于评估模型执行任务 (T) 效果的量化指标。指标的选择取决于任务。示例包括:

  • 准确率 (Accuracy)、精确率 (Precision)、召回率 (Recall)、F1 分数 (F1-score)、AUC: 用于分类任务。
  • 均方误差 (Mean Squared Error, MSE)、平均绝对误差 (Mean Absolute Error, MAE)、R 平方 (R-squared): 用于回归任务。
  • 累积奖励: 用于强化学习任务。

机器学习的目标是利用经验 (E) 来提高在任务 (T) 上的性能 (P)。

尽管取得了快速发展,机器学习仍面临一些持续的挑战:

  • 数据质量与数量: 数据不足、有噪声或不具代表性会严重阻碍模型性能。获取足够的高质量带标签数据可能成本很高。
  • 过拟合 (Overfitting) 与欠拟合 (Underfitting): 模型可能对训练数据学习得太好(过拟合),导致无法泛化到新数据;或者过于简单而无法捕捉底层模式(欠拟合)。
  • 维度灾难 (Curse of Dimensionality): 随着特征(维度)数量的增加,模型性能可能会下降,需要更多数据和复杂技术。
  • 计算成本: 训练复杂模型(特别是深度学习模型)可能需要大量时间和计算资源。
  • 可解释性与可解释人工智能 (Interpretability and Explainability, XAI): 理解一个复杂模型做出特定预测的原因(尤其是在医疗保健或金融等高风险领域)至关重要,但这通常很困难。
  • 偏差与公平性: 在有偏差的数据上训练的模型可能延续甚至放大社会偏差,导致不公平的结果。
  • 部署与监控 (MLOps): 将模型从研究阶段推向健壮的生产系统并随时间监控其性能,带来了工程挑战。
  • 专业知识需求: 设计、构建和维护有效的机器学习系统需要专业技能。

机器学习正在改变众多领域。一些常见的应用包括:

  • 医疗健康: 疾病诊断、药物研发、个性化治疗方案。
  • 金融: 欺诈检测、算法交易、信用评分、风险管理。
  • 零售与电子商务: 推荐系统、客户细分、价格优化、库存管理。
  • 交通: 自动驾驶汽车、交通预测、路线优化。
  • 娱乐: 内容推荐(电影、音乐)、游戏 AI。
  • 自然语言处理 (Natural Language Processing, NLP): 机器翻译、情感分析、聊天机器人、文本摘要。
  • 计算机视觉 (Computer Vision): 图像识别、目标检测、人脸识别、医学图像分析。
  • 安全: 入侵检测、恶意软件分析、垃圾邮件过滤。
  • 科学: 气候建模、基因组测序分析、新材料发现。